516万smORF、2.5万SEP:多组学整合+Orbitrap Astral,看清肠道"隐形蛋白"
一句话结论:人类肠道微生物里藏着大量**≤100 aa 的超小分子蛋白(SEP)**,过去因太小、丰度太低而被常规蛋白质组"漏检"。Nature Communications 最新研究把**宏基因组 + 宏转录组 + 高分辨质谱(Orbitrap Astral DIA)**整合进同一次测量,不做尺寸富集就检出 **25,233 个 SEP(每样本约 1,600 个)**,为迄今最大规模,并给出了一套可直接复用的 smORF 预测 + 嵌入式搜库工作流。
做蛋白质组学服务的人都知道一个"老大难":标准搜库库基本只收录 ≥100 aa 的蛋白,而微生物基因组里大量 smORF(小开放阅读框,small open reading frame)——长度常只有十几到上百个氨基酸——编码的产物(SEP,smORF-encoded protein)长期被当成"噪声"或"假 ORF"直接忽略。
可现实是,这些"隐形蛋白"一点都不隐形:文献报道它们在抗菌素耐药、核糖体与翻译调控、乃至癌症、心血管疾病、神经疾病里都有戏份;在枯草芽孢杆菌里,SEP 甚至占全部鉴定蛋白的 12%。问题从来不是"有没有",而是传统质谱的灵敏度与动态范围够不够把它们从复杂菌群背景里捞出来。
这篇 Nature Communications(2026, 17:6296,ORNL Hettich 组与卢森堡大学 Wilmes 组)给出的答案很干脆:用最新一代高分辨质谱 Orbitrap Astral,配合一套把多组学预测嵌进搜库库的工作流,不靠尺寸富集、不靠 de novo 测序,就把人类粪便菌群里的 SEP 全景一次性测了出来。下面用 5 张关键图讲清楚它到底强在哪。
一、研究思路:把"预测"和"实测"装进同一次测量
整套工作流的核心,是不让 smORF 预测和蛋白质鉴定各干各的,而是把预测结果直接嵌进每个样本的搜库库里。
流程分四步:
多组学建库
:41 例健康人粪便样本,分别提取 DNA/RNA,得到宏基因组(MG)与宏转录组(MT)reads,用 Integrated Meta-omics Pipeline(IMP)共组装,产出预测蛋白与 contigs; smORF 预测流水线
:在 IMP contigs 上跑定制化 smORF 预测,且特意拆成两条分支——一条专攻 <20 aa 的超短 smORF,一条负责 ≥20 aa 的较长 smORF,绕开基因调用器对"最小基因长度"的单一限制,避免顾此失彼; 嵌入式搜库库
:每个样本的搜库库 = 预测的 smORFs + IMP 蛋白 + 人参考蛋白组 + 常见污染物(cRAP),并做了去人源/去污染物、去截短、去假 ORF 等多道质控; 高分辨质谱深挖
:用 ThermoFisher Orbitrap Astral(DIA) 做非靶向宏蛋白质组,同时把老一代 Q Exactive Plus(DDA) 作为对照,直接比灵敏度。

▲ 图1|smORF 预测、数据库构建与健康人粪便样本宏蛋白质组分析的一体化工作流。左:MG+MT 经 IMP 共组装,产出预测蛋白与 contigs;中:定制化 smORF 预测流水线(<20 aa / ≥20 aa 双分支 + 多道质控);右:每样本搜库库构成(预测 smORF + IMP 蛋白 + 人参考组 + cRAP),并同时用 Orbitrap Astral(DIA)与 Q Exactive Plus(DDA)两种质谱平台对比。
一句话概括:先把"可能有哪些小蛋白"用计算预测列好清单,再把清单塞进搜库库让质谱去验证,而不是盲搜。
二、预测规模:516 万 smORF,每样本约 12.6 万
预测本身就已是海量。全样本累计预测出 5,160,834 个 smORF,平均每样本 125,874 个(最少 68,721,最多 201,998)。
去冗余后,得到 3,760,596 个非冗余 smORF:其中 321 万为单样本独有,54 万出现在至少 2 个样本,而有 49 个"核心 smORF"在全部 41 个样本里都存在——这群跨人都保守的小蛋白,很可能是菌群的"刚需元件"。
长度分布上,smORF 跨度从 8 到 100 aa(研究把上限设到 100 aa,下限压到 5 aa)。关键一点:86.6% 的 smORF 落在 50–100 aa 区间——这直接说明,传统以 50 aa 为 cutoff 的工具(如 smORFinder)会漏掉一大截真正有功能的"较长小蛋白"。

▲ 图2|smORF 预测总览。A:每样本预测 smORF 数量(n=41,箱线图含中位数、四分位与均值菱形);B:每样本预测总量,区分独有(深红)、共享(粉)与人源 smORF(蓝),并附三者占比饼图;C:以 3 氨基酸为 bin 的序列长度分布,以及 >50 aa 与 ≤50 aa 的占比饼图。
三、谁在编码?分类与功能全景
把 516 万 smORF 做分类与功能注释,画面非常集中:
- 分类上:细菌占绝对主导(仅 0.2% 为古菌)。门水平 Bacillota(厚壁菌门)占 61.8%;纲水平 Clostridia(梭菌纲)高达 57.5%;目水平以同为梭菌纲的 Oscillospirales(25.3%)和 Lachnospirales(21.4%) 最盛。属水平 Blautia、Faecalibacterium、Bacteroides 居前。 - 功能上:COG 注释显示,smORF 最富集于 "J:翻译、核糖体结构与生物合成",其次是转录(K)、碳水化合物转运与代谢(G)、能量产生(C)等;与 Global Microbial smORF Catalog(GMSC)比对,89.95% 的 smORF 有同源,其中 70.7 万(20.90%)属于 GMSC 高质量集。

▲ 图3|预测 smORF 的分类与功能注释。A:目水平分类(古菌合并为 Archaea,占比 <2% 的归入 Others);B:各功能数据库(Mantis)对 smORF 的注释覆盖率;C:COG 功能大类("J 翻译/核糖体"最突出,其次 K、G、R、C 等);D:前十大目(对数刻度)与其对应功能类别的堆叠。
四、质谱实测:Orbitrap Astral 不做富集就检出 2.5 万 SEP
这才是研究的"硬核"部分。用 Orbitrap Astral 对每个样本做非靶向宏蛋白质组,SEP 特异性(肽水平)错误发现率(FDR)经诱饵库法验证,均值仅 6.3%(±1.4%)——说明检出的小蛋白是"真阳性",不是假峰。
结果规模空前:每样本平均检出 1,600+ 个 SEP,占样本总蛋白数的 7.6%;全样本累计 25,233 个非冗余 SEP。这些都没有用任何尺寸富集,直接在非靶向测量里一网打尽,远超此前文献报道的人肠道 SEP 检出量。
对照老平台 Q Exactive Plus(DDA)更显 Astral 优势:同一批样本,Q Exactive Plus 平均每样本只检出 556 个 SEP、累计 8,332 个(FDR 还略高,7.4%)。新一代仪器把 SEP 检出量拉高了约 3 倍。
从长度看,绝大多数 SEP 落在 85–100 aa(占 40%);真正 <25 aa 的只有 13 个,最小检出 21 aa——印证了"把上限放到 100 aa"的必要性,也提示极短 smORF 的质谱检出仍受肽段长度下限(约 7 aa)制约。

▲ 图4|基于 Orbitrap Astral 的 SEP 检出。A:SEP 特异性(肽水平)FDR 分布(诱饵库法,n=12);B:每样本检出的 SEP 总数(n=41);C:SEP 在 1 / 2–9 / 10–19 / 20–29 / 30–41 个样本中的存在分布;D:全部检出 SEP 的序列长度分布(bin=5)。
五、SEP 真面目:近半数与"翻译"相关,梭菌纲占六成丰度
检出之后,再给 SEP 做"身份画像":
- 分类:94.5% 的 SEP 丰度来自细菌,仅 1.1% 来自古菌或人源;Clostridia(梭菌纲)独占 60.2% 的 SEP 丰度,与全局蛋白组的分类格局一致,说明检出的小蛋白是真实生物学信号而非假命中。属水平 Blautia 贡献 5.9%。87% 的 SEP 丰度能定位到门水平。 - 功能:基于 COG,近 43% 映射到 SEP 的肽段与"翻译"(J 类)相关,包含多个经典小核糖体蛋白——这既是重要的"金标准"背书,也提示 SEP 里有大量核糖体/翻译调控元件;此外 SEP 还显著富集于碳水化合物代谢与转运、信号转导,暗示它们在微生物处理营养、感知环境里扮演角色。 - 保守性:18,092 个 SEP 仅见于单个样本;仅 605 个(2.3%)出现在 ≥20 个样本。但越保守的 SEP 贡献越多丰度——在 ≥20 样本的"保守 SEP"虽只占数量 25%,却占 46% 的丰度;在 ≥30 样本的,占数量 11.6%、丰度 29%。另外,49 个核心 smORF 里有 17 个在至少 1 个样本里被实测到蛋白表达,7 个出现在 ≥20 样本。

▲ 图5|检出 SEP 的分类与功能归属。A:SEP 按丰度的平均分类组成(至目水平,蓝框示 Bacillota 贡献);B:15 个功能库对每个样本 SEP 未注释比例的平均值;C:SEP 丰度的 COG 功能类别("J 翻译"近半最突出);D:贡献 smORF 丰度前十大目的热图,及其在不同 COG 类别中的百分比构成。
六、写在最后:对蛋白组学服务的三点启示
把这篇论文串起来,对做宏蛋白质组 / 多组学技术服务的团队,有三点很实在的启发:
传统搜库库在"系统性漏检"小蛋白。
标准库几乎只收 ≥100 aa,等于默认 SEP 不存在。这篇研究证明:把 smORF 预测(含 <20 aa 双分支 + 多道质控)直接嵌进每样本搜库库,是低成本、高回报的改法——预测与实测在同一次测量里互相印证。 仪器代差直接决定小蛋白检出天花板。
Orbitrap Astral(DIA)相对 Q Exactive Plus(DDA),SEP 检出量约 3 倍差距,且 FDR 更低。对菌群、宿主低丰度小蛋白,高分辨宽动态范围仪器几乎是必选项。 "嵌入式 smORF 库 + 高分辨非靶向"会成为增值项。
当客户样本只跑了常规宏蛋白质组,是否可以把 SEP 这一层补回来,再去解释菌群功能(尤其翻译、碳水代谢、信号转导)?这很可能成为下一阶段宏蛋白质组分析的标准增值点。
对提供 DIA 质谱、微生物组与多组学服务的团队来说,这篇 Nature Communications 既是一份方法学范本,也是一张"别再漏掉小蛋白"的提醒单。
*本文基于 Nature Communications 论文《High-resolution multi-omics enhances prediction and detection of smORF-encoded proteins in the human gut microbiome》整理。*



English

