联系电话:
400-617-1706
基质辅助激光解吸电离飞行时间质谱(MALDI-TOF MS)依靠核糖体蛋白指纹图谱,已成为临床微生物实验室细菌快速鉴定的主流技术。而传统商业软件依赖私有黑盒数据库,存在可复现性、透明度不足等问题;早期机器学习采集图谱研究大多基于小数据集、有限物种,缺少标准化评测框架,普遍高估模型实际性能。
本研究依据大样本基准研究首次明确划分三类真实应用场景:新生物学重复(训练集已有菌株的新样本);新菌株(训练集已有物种,但菌株从未出现);新物种(分布外样本OOD)(训练集完全未出现的物种)。不同场景模型性能差异巨大,现有大量文献混淆三类任务,造成评估虚高。
主流分析线:分箱(binning)→基线校正(ALS非对称最小二乘)→总离子流归一化(TIC)。
通过更小分箱窗口(5 m/z)可保留更多质谱信息,提升模型性能;并发现逻辑回归模型在TIC归一化后性能会显著崩塌,不同算法对预处理的敏感性差异明显;由此在多中心研究中,批次效应校正(ComBat等)成为预处理新增关键环节,解决不同实验室、仪器带来的质谱偏移,显著提升跨中心泛化能力。

以Lactococcus garvieae的原始光谱示例,以及不同的预处理步骤:归类5m/z进行分箱,并通过基线校正(ALS)和总离子电流归一化(TIC)进行转换(通过基线校正估计的基线在右上方的图中用红色表示)
分为平面分类(Flat Classification)与层次分类(Hierarchical Classification)两大路线。
传统机器学习(KNN、LSVC、RF、逻辑回归):大规模基准测试中KNN、线性SVC在新菌株、新生物学重复任务中表现最优。KNN在新菌株场景物种精度84.78%;LSVC在生物学重复场景物种精度可达96.15%。
一维卷积神经网络1D-CNN:没有在大规模数据集上超越传统机器学习;优势是对预处理鲁棒性强、训练速度快,适合十万级以上海量质谱数据,为单细胞MALDI-TOF大数据提供算力基础。
层次分类(LCPN,每个父节点训练独立分类器):物种水平识别性能并不优于平面分类,证明 MALDI-TOF 质谱信号没有很好保留物种进化/分类学信息;但属、科层级识别准确率更高,适合 “识别不确定时退回到更高分类单元输出结果” 的临床需求,同时推理时间复杂度更低(对数级)。
进化亲缘关系近的细菌,质谱指纹不一定相似,这是层次分类无法带来增益的核心原因。
真实临床样本鉴定中经常出现数据库没有收录的未知菌种,普通多分类模型只能输出训练集中已有的类别,无法识别新物种,需要开放集识别/异常检测技术。
蒙特卡洛Dropout(MCDropout)贝叶斯神经网络:在1DCNN上开启训练+测试阶段dropout率,通过预测后验分布的Shannon熵计算总不确定性,用来区分已知物种与未知新物种。当dropout率为0.8时AUROC可达0.9997,AUPR达到0.9975,显著优于KNN距离判别方法,是该领域首个大规模验证的深度学习开放集方案。
近年拓展方向:区分偶然不确定性(数据噪声)与认知不确定性(模型知识缺失),进一步提升未知物种检出能力;高斯过程、Dirichlet先验网络也开始引入MALDITOF质谱开放集任务,但整体缺少大规模数据集验证。


从物种鉴定向下延伸到亚种、血清型、序列分型ST:针对脓肿分枝杆菌复合群、沙门氏菌血清分型、大肠杆菌ST分型,结合特征筛选、类别均衡算法,实现亚种级别区分;但跨中心批次效应会严重削弱模型效果,需要多中心harmonization策略。
MALDI-ST分型深度学习框架,直接从质谱完成主要致病菌ST分型,为分子分型提供快速经济替代方案,但外部验证性能下降明显,距离临床落地仍有距离。
数据集规模带来性能鸿沟:小数据集实验报告的准确率普遍虚高,通过近10万谱图、千级物种的大规模基准测试,所有模型的真实性能显著下降。传统k-fold交叉验证不适合该领域,普通交叉验证会混合生物学重复菌株,无法评估模型对新菌株泛化能力;必须按照菌株/物种进行划分测试集,而不是随机划分谱图样本。
质谱数据与分类学信息不完全匹配:亲缘关系近的物种质谱不一定相似,限制层次分类、进化引导模型的收益;近缘物种(大肠杆菌志贺菌、部分分枝杆菌复合体)仍是鉴定难点。
数据资源壁垒:高质量大规模标注 MALDI-TOF 质谱数据集稀缺,多数优质数据被商业厂商私有数据库收录;开源数据集数量有限,制约算法迭代。
模型可解释性不足:深度学习黑盒,难以定位哪些m/z峰驱动分类;SHAP等可解释AI开始用于挖掘分类相关蛋白峰,是重要发展方向。
批次效应:不同仪器、实验室、培养条件带来质谱偏移,单中心训练模型在外部医院数据集性能明显衰减,多中心校正方案是落地必要环节。
长按下方二维码下载文献原文:

关键搜索
资源中心
解决方案