400-617-1706info@DW-Microbiology.com
首页>资源分享>应用文献>【学术前沿】MALDI-TOF质谱和机器学习技术鉴定细菌物种大规模的基准研究

【学术前沿】MALDI-TOF质谱和机器学习技术鉴定细菌物种大规模的基准研究

时间:2026-08-28      浏览:1
一、研究背景

基质辅助激光解吸电离飞行时间质谱(MALDI-TOF MS)依靠核糖体蛋白指纹图谱,已成为临床微生物实验室细菌快速鉴定的主流技术。传统商业软件依赖私有黑盒数据库,存在可复现性、透明度不足等问题;早期机器学习采集图谱研究大多基于小数据集、有限物种,缺少标准化评测框架,普遍高估模型实际性能。

本研究依据大样本基准研究首次明确划分三类真实应用场景:新生物学重复(训练集已有菌株的新样本);新菌株(训练集已有物种,但菌株从未出现);新物种(分布外样本OOD)(训练集完全未出现的物种)。不同场景模型性能差异巨大,现有大量文献混淆三类任务,造成评估虚高。

 

二、主流技术范式前沿进展

2.1 数据预处理

主流分析线:分箱(binning基线校正ALS非对称最小二乘)总离子流归一化TIC

 

通过更小分箱窗口(5 m/z)可保留更多质谱信息,提升模型性能;并发现逻辑回归模型在TIC归一化后性能会显著崩塌,不同算法对预处理的敏感性差异明显;由此在多中心研究中,批次效应校正(ComBat等)成为预处理新增关键环节,解决不同实验室、仪器带来的质谱偏移,显著提升跨中心泛化能力。

 

 

Lactococcus garvieae的原始光谱示例,以及不同的预处理步骤:归类5m/z进行分箱,并通过基线校正(ALS)和总离子电流归一化(TIC)进行转换通过基线校正估计的基线在右上方的图中用红色表示

 

2.2 闭集识别模型(已知物种分类)

分为平面分类Flat Classification层次分类Hierarchical Classification两大路线。

传统机器学习(KNNLSVCRF、逻辑回归):大规模基准测试中KNN、线性SVC在新菌株、新生物学重复任务中表现最优。KNN在新菌株场景物种精度84.78%LSVC在生物学重复场景物种精度可达96.15%

一维卷积神经网络1D-CNN:没有在大规模数据集上超越传统机器学习;优势是对预处理鲁棒性强、训练速度快,适合十万级以上海量质谱数据,为单细胞MALDI-TOF大数据提供算力基础。

层次分类(LCPN,每个父节点训练独立分类器):物种水平识别性能并不优于平面分类,证明 MALDI-TOF 质谱信号没有很好保留物种进化/分类学信息;但属、科层级识别准确率更高,适合 识别不确定时退回到更高分类单元输出结果的临床需求,同时推理时间复杂度更低(对数级)。

进化亲缘关系近的细菌,质谱指纹不一定相似,这是层次分类无法带来增益的核心原因。

 

2.3 开放集/未知物种检测(分布外OOD检测,前沿热点)

真实临床样本鉴定中经常出现数据库没有收录的未知菌种,普通多分类模型只能输出训练集中已有的类别,无法识别新物种,需要开放集识别/异常检测技术。

蒙特卡洛DropoutMCDropout)贝叶斯神经网络:1DCNN上开启训练+测试阶段dropout,通过预测后验分布的Shannon熵计算总不确定性,用来区分已知物种与未知新物种。当dropout0.8AUROC可达0.9997AUPR达到0.9975,显著优于KNN距离判别方法,是该领域首个大规模验证的深度学习开放集方案。

近年拓展方向:区分偶然不确定性(数据噪声)与认知不确定性(模型知识缺失),进一步提升未知物种检出能力;高斯过程、Dirichlet先验网络也开始引入MALDITOF质谱开放集任务,但整体缺少大规模数据集验证。

在新物种情景下,KNN1DCNN分别以0.20.40.60.8dropout率绘制ROC曲线和查准率曲线,1DCNN的性能更好

 

原始特征空间与CNN高层特征空间下分布内外样本PCA可视化

 

2.4 向下细分:亚种、血清型、ST分型(新兴方向)

从物种鉴定向下延伸到亚种、血清型、序列分型ST:针对脓肿分枝杆菌复合群、沙门氏菌血清分型、大肠杆菌ST分型,结合特征筛选、类别均衡算法,实现亚种级别区分;但跨中心批次效应会严重削弱模型效果,需要多中心harmonization策略。

MALDI-ST分型深度学习框架,直接从质谱完成主要致病菌ST分型,为分子分型提供快速经济替代方案,但外部验证性能下降明显,距离临床落地仍有距离。

 

三、关键科学发现与现存瓶颈

数据集规模带来性能鸿沟:小数据集实验报告的准确率普遍虚高通过10万谱图、千级物种的大规模基准测试,所有模型的真实性能显著下降。传统k-fold交叉验证不适合该领域,普通交叉验证会混合生物学重复菌株,无法评估模型对新菌株泛化能力;必须按照菌株/物种进行划分测试集,而不是随机划分谱图样本。

质谱数据与分类学信息不完全匹配:亲缘关系近的物种质谱不一定相似,限制层次分类、进化引导模型的收益;近缘物种(大肠杆菌志贺菌、部分分枝杆菌复合体)仍是鉴定难点。

数据资源壁垒:高质量大规模标注 MALDI-TOF 质谱数据集稀缺,多数优质数据被商业厂商私有数据库收录;开源数据集数量有限,制约算法迭代。

模型可解释性不足:深度学习黑盒,难以定位哪些m/z峰驱动分类;SHAP等可解释AI开始用于挖掘分类相关蛋白峰,是重要发展方向。

批次效应:不同仪器、实验室、培养条件带来质谱偏移,单中心训练模型在外部医院数据集性能明显衰减,多中心校正方案是落地必要环节。

 

四、未来前沿方向
  1. 标准化评测体系建设:统一区分新生物学重复、新菌株、新物种三类任务,建立公开基准数据集,推动领域放弃简单随机交叉验证,采用菌株隔离式评测范式。
  2. 开放集识别技术深化:对比更多贝叶斯网络、生成模型、距离度量学习方案;拆分偶然/认知不确定性,提升未知物种、罕见病原体检出能力。
  3. 多任务联合建模:一套模型同时完成物种鉴定、亚种分型、耐药表型预测,将 MALDI-TOF 从单纯菌种识别拓展到耐药快速筛查,已有部分临床原型系统报道。
  4. 跨中心鲁棒模型:开发批次效应校正、域自适应算法,解决不同医院、不同型号质谱仪器之间的迁移问题,推动机器学习模型走出实验室走向临床流水线。
  5. 可解释机器学习:挖掘与分类、耐药相关的特征m/z峰,将深度学习输出与蛋白质组生物学知识结合,摆脱纯黑盒模型。
  6. 单细胞MALDITOF结合AI:无需培养直接对单细菌采集谱图,结合高效深度学习,实现免培养直接临床样本鉴定,是下一代微生物诊断方向。

长按下方二维码下载文献原文:

 

  1. Thomas Mortier, Anneleen D. Wieme, Peter Vandamme, Willem Waegeman. Bacterial species identification using MALDI-TOF mass spectrometry and machine learning techniques: A large-scale benchmarking study. Comput Struct Biotechnol J. 2021;19:6157-6168.

 

 

Pardot iFrame Resizing
  • 姓名

  • 联系电话

  • 常用邮箱

  • 单位名称

  • 地区

  • 应用领域

  • 验证码

杭州大微生物技术有限公司

Hangzhou DW Microbiology Co., Ltd
中国. 浙江省杭州市余杭区良渚街道通运街362号11幢
隐私策略使用条款商标网站地图 © 2021 杭州大微生物技术有限公司    备案号:浙ICP备2021005851号-1

联系电话:
400-617-1706

微信服务号