让质谱直接"写出"代谢物分子结构
2026 年 4 月 7 日,Nature Communications 上线了一项重磅研究:上海有机化学研究所朱正江/王洪淼团队开发的 **MetGenX**——一个"结构引导"的深度生成模型,能把一张二级质谱(MS²)谱图直接翻译成一个全新的代谢物分子结构。在 1,388 张 NIST 独立测试谱上,Top-1 准确率 55.9%;在 1,681 张真实生物样本谱上,Top-1 准确率 68.5%、Top-3 89.2%,**全面超越 CFM-ID、MS-FINDER、MetFrag、MSNovelist、ICEBERG**。更硬核的是:把这一流程搬到小鼠肝脏非靶向代谢组数据里,**真的挖出了 2 个 HMDB/KEGG/PubChem 都没有的全新代谢物**——并用化学标准品合成了对照,把 RT 和 MS² 全对上了。本文带你拆解 MetGenX 的核心机制与实战数据。
一、为什么"未靶向代谢组学"卡在标注这一关
未靶向代谢组学(untargeted metabolomics)号称能"无偏"地把一个生物体系里所有可检测的小分子一网打尽。但十几年来,整个领域的核心痛点始终是同一个:
- 库匹配(library matching) 仍是金标准,但只认"已有标准品 + 已测参考谱"的那部分代谢物。 - 现实样本里大量代谢物属于 "known unknowns"(HMDB/KEGG 等结构库里有结构、但没参考谱)和 "unknown unknowns"(连结构都未知)。 - 现有的 in silico 工具(CFM-ID、MS-FINDER、MetFrag、SIRIUS+CSI:FingerID 等)本质都是"从谱图预测分子指纹或预测谱",绕不开结构库这一关——见不到的东西就认不出。 - 近两年的深度生成模型(MSNovelist、Spec2Mol、DiffMS)虽然号称能"de novo"造结构,但训练数据极度依赖参考谱——所有公共参考谱库拼起来,unique 分子也才 6 万左右,比一个像样的深度生成模型需要的 1–2 百万结构样本差一两个数量级。
所以现实是:LC-MS 数据越采越多,能认出来的代谢物比例却一直在 10%–30% 之间徘徊。剩下的"暗物质",就成了制约代谢组学走向真正"无偏"的瓶颈。
二、MetGenX 的核心思路:把"谱图→结构"换成"结构→结构"

▲ 图1 MetGenX 整体框架。三大模块:模板搜索 → 模板编码 → 结构生成,并配合机器学习重排序。© Nature Communications, 2026.
MetGenX 没有试图让模型"硬学"从谱图到结构的端到端映射,而是做了一件很聪明的事——先借力已知结构,再去生成未知结构。整体框架分三步(Fig. 1):
- a 模板搜索(Template search):把查询的 MS² 谱用 Word2Vec 做文本化嵌入(peak@xx.xx、nl@xx.xx 这种"词"),再通过余弦相似度在参考谱库里检索"结构相似"的代谢物分子。这些被检索出来的分子,就是"结构模板"。 - b 模板编码(Template encoding):每个模板被编码成一个 3,898 维的特征向量——3,878 位结构指纹 + 10 位分子式 + 10 位分子式差。 - c 结构生成(Structure generation):把多个模板的特征向量拼接后丢进一个 encoder-decoder(6 层 Transformer 解码器),以 SMILES 字符串的形式生成最终候选结构。
最后还有一个 LightGBM 重排序模型:基于"生成结构 vs 检索模板"的 12 维特征(谱相似度、结构相似度、模板数、模型分、分子复杂度、NP score、SMILES 长度等),给候选结构重新打分。
这套设计的精髓是:把"spectrum-to-structure"问题,巧妙地重写为"structure-to-structure"问题——直接利用了 2.17 百万的生物相关结构库,绕开了参考谱数据稀缺的瓶颈。
三、训练策略:217 万结构预训练 + NIST 微调

▲ 图2 MetGenX 的两阶段训练与重排序。a 预训练阶段在 2.17M 生物相关结构上进行;b 微调阶段用 23,213 张 NIST 谱图把模型对齐到"谱图→结构"任务;c 用 LightGBM 对生成候选做重排序。© Nature Communications, 2026.
训练分两步(Fig. 2):
预训练(structure-to-structure)
:用 0.52M 代谢物/天然产物(COCONUT、HMDB、NIST20、GNPS)+ 1.76M PubChem 生物相关结构(共 2.17M),让 encoder-decoder 先学会"给定一组相似结构,生成另一个合理结构"。预训练在 33 个 epoch 后收敛。 微调(spectrum-to-structure)
:用 NIST20 的 23,213 张 MS² 谱(Orbitrap 仪器,正模式),按 9:1 划分训练/验证集,1,500 张独立测试集。微调时把"输入模板"换成由谱图检索得到的真实模板,让模型学会"从谱图出发去生成结构"。
两个 ablation 结论很关键:
- 结构预训练 + 模板搜索这两个组件缺一不可——少了任何一项,准确率都会明显掉; - 重排序模型里结构相似度相关特征贡献最大,印证了"模板引导"才是核心信号源。
四、NIST 独立测试集:把"结构生出来"这件事做对

▲ 图3 MetGenX 在 1,500 张 NIST 独立测试谱(去重叠结构)上的表现。a 评估流程;b 92.5% 的谱都能检索到至少 1 个模板;c 数据库受限模式下 Top-1/Top-3 准确率;d RRP 分布;e 数据库自由模式准确率;f 候选结构与真值的结构相似度分布;g,h 两个示例(吡哆胺、2-乙氧基苯胺)。© Nature Communications, 2026.
评估用了 1,500 张与训练集结构不重叠的 NIST 谱,最后能成功检索到模板的 1,388 张进入生成评估:
- 数据库受限模式(database-restricted,背景库 0.52M 结构):Top-1 = 48.9% → 重排序后 55.9%;Top-3 = 71.8% → 76.1%。RRP 中位数为 1.00,说明正确结构基本都在 Top-1。 - 数据库自由模式(database-free,de novo):Top-1 = 21.7%,Top-3 = 35.0%。绝对值看起来没那么夸张,但Top-3 候选中 75.0% 与真值具有高结构相似度——意味着"没说中名字,但说中了化学家族"。
两个示例很说明问题:
- 吡哆胺(pyridoxamine):在数据库受限模式下,用 4 个 B6 维生素类模板,成功 Top-1 命中。 - 2-乙氧基苯胺(2-ethoxyaniline):在数据库自由模式下,用 4 个结构相似模板,Top-1 命中。
作者还做了一个有意思的统计:当最大结构相似度 > 0.71 时(Youden's J 拐点),生成正确的概率显著上升——这反过来给"模板检索"的质量定了一个可解释的阈值。
五、真实生物样本:5 类组织、1,720 张谱图、6 工具同台对比

▲ 图4 MetGenX 在真实生物样本上的表现与 6 工具横评。a 评估工作流;b 各样本类型的谱图数(库匹配 vs MetGenX);c 各样本类型 Top-N 准确率;d,e 按加合物/化学子类别的准确率分层;f,g 与 CFM-ID、MSNovelist、MetFrag、MS-FINDER、ICEBERG 的覆盖度与准确率对比。© Nature Communications, 2026.
把舞台从"标准库"搬到"真实样本"才是真正的考验。作者在 5 类真实生物样本(细胞、脑、肝、血浆、尿液)里共采集了 1,720 张 MS² 谱,先用自家标准库做 Level 1 注释作 ground truth,再喂给 MetGenX:
- 覆盖率:1,720 张谱里 MetGenX 成功标注 1,681 张(97.7%),与 ICEBERG(97.8%)相当,远超 MS-FINDER(73.3%)。 - 准确率:Top-1 = 68.5%,Top-3 = 89.2%,Top-5 = 94.5%——按代谢物去重后 Top-1 = 64.9%、Top-3 = 85.3%。 - 加合物维度:[M+H]+ Top-3 90.5%、[M-H₂O+H]+ 76.8%、[M+Na]+ 60.0%。 - 化学类别维度:脂质(lipids)表现尤其亮眼——结构规律性强、模板丰富。
横评 5 个主流 in silico 工具:
- MetGenX Top-3 89.2% > ICEBERG 81.0% > CFM-ID 67.4% > MS-FINDER 56.4% > MetFrag 57.4% > MSNovelist(具体见原图 4g)。 - 覆盖度与准确率同时占优——这正是现有工具的痛点:传统方法覆盖度低(CFM-ID 88.9%),生成类方法准确率低(MSNovelist 较低)。
最后用 200 个 spike-in 代谢物标准品做了一次"盲测":在 mouse liver 中检测到 177 个,MetGenX Top-3 = 92.1%;NIST 1950 血浆中检测到 166 个,MetGenX Top-3 = 89.2%——与无 spike-in 时的 89.2%/82.5% 几乎完全对齐,证明标注结果稳健可信。
六、跨模式泛化:正/负离子模式不需要重训

▲ 图5 MetGenX 在负离子模式下的表现。a 同一模型直接用于负模式;b,c 负模式数据库受限/自由生成 Top-N 准确率;d 各生物样本类型 Top-N 准确率;e,f 6 工具横评(覆盖度与准确率)。© Nature Communications, 2026.
负离子模式一直是非靶向代谢组学的"硬骨头"——参考谱少、工具表现普遍下滑。MetGenX 因为走的是"结构引导"路线,不需要在负模式数据上重新训练,模型就直接能用:
- 在 653 张 NIST 负模式测试谱上:Top-1 49.7%、Top-3 75.4%(数据库受限),与正模式表现几乎相当。 - 真实生物样本(2,417 张谱):Top-1 60.7%、Top-3 82.5%——再次横扫 CFM-ID(53.0%)、MetFrag(57.4%)、MS-FINDER(60.4%)、ICEBERG(71.2%)。 - 同 spike-in 验证逻辑下,mouse liver Top-3 92.1%,NIST 血浆 Top-3 89.2%——正负两套体系下结论一致。
这套"零重训"的能力对于实际项目意义重大:很多实验室切正负模式跑两套流程,过去都得为负模式单独训练/微调模型,MetGenX 一次训练两套模式通用。
七、真正的硬菜:小鼠肝脏挖出 2 个全新代谢物

▲ 图6 MetGenX 在小鼠肝脏未靶向代谢组数据中的实战表现。a 多步骤注释工作流(库匹配→数据库受限→数据库自由);b 腺苷酰半胱氨酸结构;c 用合成标准品验证 RT 与 MS²;d 该代谢物在不同组织中的丰度分布;e 腺苷 5′-二磷酸 5′-肌苷(Ap2I)结构;f 用合成标准品验证;g Ap2I 在不同组织中的丰度分布。© Nature Communications, 2026.
最后,也是最让人兴奋的部分:作者把 MetGenX 用到了一个真实未靶向代谢组学项目——小鼠肝脏(6,564 个带 MS² 的代谢特征,2,979 个能确定分子式)。
他们设计了一个多步骤注释工作流(Fig. 6a):
库匹配(Level 1 注释)—— 命中 516 张; 数据库受限模式 —— 命中高质量候选 541 张(candidate score > 1.2); 数据库自由模式 —— 再多覆盖 1,528 张; 剩下 394 张彻底无法生成,可能真的就是"未知的未知"。
最硬核的两个发现:
7.1 腺苷酰半胱氨酸(adenosyl-cysteine,C₁₃H₁₈N₆O₅S)
- m/z = 371.1131,RT = 394 s,分子式 C₁₃H₁₈N₆O₅S。 - 在数据库受限模式下,用一组核苷酸相关模板生成,Top-1 候选得分 2.0。 - 关键:HMDB 和 KEGG 里都没有这条结构。 - 用化学标准品合成后做对比,RT 与 MS² 完全对得上。 - 组织分布:肾 > 肝 > 其他;在脂肪、肌肉中几乎检测不到。 - 浓度:约 10.80 ± 0.10 pmol/mg 组织。
7.2 腺苷 5′-二磷酸 5′-肌苷(Ap2I,C₂₀H₂₅N₉O₁₄P₂)
- m/z = 678.1066,RT = 439 s,分子式 连背景库都没有。 - 在数据库自由模式下,用核苷酸相关模板引导,MetGenX 把 "adenosine 5′-diphosphate 5′-inosine (Ap2I)" 推为 Top-3 之一(候选得分 2.6)。 - 关键:Ap2I 是一种此前未被表征的二核苷酸多磷酸(dinucleoside polyphosphate),连 PubChem 都没有。 - 多重实验验证: - 合成标准品的 RT 与 MS² 与生物峰一致(正负模式都对上); - 把 AMP + IMP 混合进样不会在 ion source 里"拼"出 Ap2I 信号——排除假阳性; - Ap2I 与 AMP/IMP/ADP/ATP 的 RT 完全不同——排除 dimer 假象; - 碰撞能量 ramp 实验中,Ap2I 前体离子强度随 CE 增大而下降,碎片离子出现——符合真正的代谢物碎片模式。 - 组织分布:脾 > 肝 > 心 > 脑;在肌肉、WAT、肠、肺中检测不到(nd)。 - 浓度:约 2.97 ± 0.92 pmol/mg 组织。
这两个发现的意义在于:MetGenX 不是在已知的化学空间里找东西,而是在帮你把"暗物质代谢组"打开一个口子。
八、与 MetDNA3、MassSpecGym 的横向对位
作者也做了"在别人场子里的较量":
- vs MetDNA3(网络传播型工具):在 20 个真实生物数据集上,MetGenX 覆盖度 84.2% vs 68.1%,但准确率 78.1% vs 84.4%——覆盖度更高,准确率略低。原因是 MetDNA3 整合了 RT 等额外信号做约束,而 MetGenX 只用 MS²。两者互为补充,而不是简单替代。 - vs MassSpecGym 基线(公共基准):数据库受限 Top-1 18.34%,超过 MIST(9.57%)、DeepSets+FF(6.56%)、Fingerprint FFN(5.09%);数据库自由 Top-1 2.50%、Top-10 4.62%,与 DiffMS(4.25%)相当,显著高于 MSNovelist/Spec2Mol/Neuraldecipher(这三个在该基准上 Top-1 = 0)。即使在"对模板不友好"的 MassSpecGym(要求测试分子与训练分子 MCES > 10),MetGenX 仍保持竞争力。
九、MetGenX 解决了哪些真正的痛点
回头看,MetGenX 的核心贡献可以浓缩成 3 件事:
把"谱图→结构"重新定义为"结构→结构"
——让生成模型能利用 200 万级结构数据训练,绕开参考谱稀缺的天花板。 模板引导 + 重排序
——让生成结果既"化学合理"又"谱图可解释",把"幻觉结构"压到可接受水平。 正/负模式通用 + 库内/库外双模式
——一套模型、一个流程,覆盖了实际项目里 90%+ 的标注场景,并在真实样本里挖出了 2 个此前没有的新代谢物。
局限性也值得注意:模板检索的覆盖率受限于参考谱库——作者统计约 7.5%–10% 的谱图检索不到合适模板,这一部分只能等谱库扩充。对"完全跳出已知化学空间"的任务,database-free 模式的 Top-1 还有提升空间。以及,重排序模型也依赖模板,理论上可能限制新骨架的探索。
十、对代谢组学/中药入血研究的启示
- 对代谢组学服务/平台:模板 + 重排序的思路可以很容易复用到自家标准库 + LightGBM/XGBoost 重排——哪怕不上深度模型,也能先吃到一波"结构引导"的红利。 - 对中药入血/网络药理学:当我们在做"原药 → 入血成分 → 靶点 → 通路"链条时,MetGenX 这种 de novo 注释工具可以帮我们把"原型药物代谢物对应的未知代谢物"找出来——尤其适合那些人参、黄芪、姜黄这类含有大量 glycoside、酰化、糖基化修饰的中药。 - 对检测方法学:当 LC-MS 报告里出现"未注释的分子式"时,MetGenX 提供了一种系统化的"猜结构 + 排序"思路,比单纯靠人工解析二级谱要快几个数量级。 - 对科研服务公司:2 个新代谢物的发现(其中一个连 PubChem 都没有)说明,算法创新直接带动"新分子发现"业务——这一点对 ToB 端的"未知物鉴定/未知代谢物 de novo 鉴定"服务来说是直接的能力升级。
十一、资源与引用
- 论文:Wang H, Zhang H, Zhu ZJ. *Structure-informed deep generation enables de novo metabolite annotation in untargeted metabolomics*. Nature Communications, 2026, 17:5426. - DOI:10.1038/s41467-026-72149-6



English

