10亿参数看全部2.8万个基因:scLong用GO知识增强重塑单细胞转录组基础模型
当 Geneformer、scGPT、scFoundation 等单细胞 RNA 测序基础模型大放异彩时,一个关键却被忽视的问题始终悬而未决:为什么它们只关注 2000 个高表达基因,而将另外 26,000 个基因排除在外?
这些被"嫌弃"的低表达基因(LEGs),恰恰是细胞调控网络中的精密开关——它们在应激反应、免疫信号、疾病进展中扮演着不可替代的角色。忽略它们,就等于在基因调控的拼图中故意丢失最关键的几块。
来自 MBZUAI、加州大学圣地亚哥分校(UCSD)、卡内基梅隆大学(CMU)等机构的联合团队给出了答案:scLong——一个拥有十亿参数的单细胞转录组基础模型,首次实现对人类全部 ~28,000 个基因的自注意力建模,并整合了 Gene Ontology(GO)功能知识图谱。
核心数字:10亿参数 · 4800万细胞预训练 · 28,000个基因全量自注意力 · Gene Ontology图卷积 · 5大下游任务全面领先
一、现有模型的两大硬伤
当前主流的单细胞基础模型面临两个根本性局限:
硬伤一:基因截断 Geneformer 只看 2048 个基因,scGPT 看 2000 个,UCE 看 1536 个——通常还只选高表达的。这意味着约90%的基因组被直接忽略,包括那些在稀有细胞类型、应激响应和疾病进程中起关键调控作用的低表达基因。 硬伤二:知识缺失 现有模型仅依赖表达数据模式,不整合 Gene Ontology 等外部基因功能知识。当表达数据稀疏或模糊时,模型无法借助已知的基因功能层级关系来"推断"未知交互。
scLong 的设计哲学正是同时解决这两个问题:全基因覆盖 + 知识增强。
二、scLong 架构:三大编码器 + 双Performer
scLong 的架构包含三个核心组件:
1. 基因编码器(Gene Encoder):基于 Gene Ontology 构建基因图谱,通过图卷积网络(GCN)学习每个基因的功能表示。两个基因若共享 GO 注释(涉及相同生物过程、分子功能或细胞组分),就在图中相连。这使得 scLong 在预训练前就已"知道"基因间的功能关系。
2. 表达编码器(Expression Encoder):一个 MLP,将每个基因的标量表达值映射为向量表示。
3. 上下文编码器(Contextual Encoder):采用 Performer(近似注意力机制)实现全基因自注意力。巧妙之处在于双编码器策略:
大 Performer:处理高表达基因(携带核心生物学信息),层数多、参数多 小 Performer:处理低表达基因(信息量较少但不可忽略),层数少、参数少 全长度 Performer:将两组输出统一处理,捕获跨表达水平的全局长程依赖
这种设计在计算效率与表示质量之间取得了平衡——既不像现有模型那样粗暴截断基因,又避免了直接对28,000个基因做标准自注意力带来的计算爆炸。
预训练任务采用掩码表达值重建(类似 BERT 的 MLM):随机遮蔽部分基因表达值,让模型预测被遮蔽的值。预训练数据涵盖 4800万个人类细胞、27,874个基因(约20,000个编码基因 + 8,000个非编码基因),来自1,618个数据集、覆盖50+种组织。
三、五大下游任务全面碾压
scLong 在5个核心任务上进行了评估,对比的基线模型包括4个基础模型(Geneformer 30M参数、scGPT 50M、scFoundation 100M、UCE 650M)和多个任务专用模型。
任务1:基因扰动转录响应预测
输入:扰动前的基因表达向量 + 扰动条件(基因敲除/过表达)输出:扰动后的基因表达向量
使用Norman数据集(91,205个细胞、5045个基因、236种扰动条件),测试分为4种泛化场景。在最具挑战性的 Seen 0/1(测试扰动条件在训练中从未出现)场景中:
scLong 还在双基因扰动的遗传交互类型分类(协同 vs 抑制)中超越了GEARS,与真实值的重叠率更高。
任务2:化学扰动转录响应预测
使用L1000数据集(7个细胞系、978个基因、810种药物化合物、6个剂量水平),预测药物处理后的基因表达谱。scLong在所有6个评估指标(RMSE、Spearman、Pearson、Pos-P@100、Neg-P@100)上均显著优于所有基线(P < 0.04)。
任务3:癌症药物响应预测
在单药响应预测中(DeepCDR数据集,102,074个训练样本),scLong 的 Pearson 相关达到 0.878,超越了 DeepCDR(0.837)和所有基础模型。在协同药物组合预测中,AUROC 达到 0.652,同样全面领先。
任务4:基因调控网络推断
使用758个人胚胎干细胞(hESC),17,735个基因,通过scLong提取基因表示并计算余弦相似度构建邻接矩阵,再用DeepSEM的beta-VAE精炼。以ChIP-Seq数据作为真实值评估:
任务5:零样本批次整合
在pancreas数据集(16,382个细胞、6个批次)上,scLong 在未经过任何训练或微调的情况下,batch ASW 达到 0.96,甚至超过了专门在此数据集上训练的 scVI(0.85)。这表明 scLong 预训练学到的表示天然具备消除批次效应的能力。
四、消融实验:每个设计选择都有据可依
消融实验从两个维度验证了scLong设计选择的有效性:
维度一:低表达基因(LEG)的价值 w/o LEG(仅保留4096个高表达基因):GRN推断AUPR从1.35降至1.11,batch ASW从0.96降至0.88Random LEG(mini Performer权重随机化):AUPR降至1.10,batch ASW降至0.90 维度二:GO知识图谱的价值 w/o GO(移除GO图和GCN,改用Gene2Vec):GRN推断AUPR从1.35降至1.12,batch ASW从0.96降至0.91Random GO(用随机图替换GO图):AUPR降至1.12,batch ASW降至0.93
值得注意的是,scLong 不仅超越了直接使用 GO 图的基线(GO Graph, AUPR=1.02),说明 scLong 并非简单复制 GO 信息,而是在训练中精炼和扩展了 GO 包含的基因关系知识。
五、为什么 scLong 能赢?
作者从三个层面给出了系统性解释:
1. 全基因自注意力:低表达基因在调控网络中充当"开关"和"调制器"。在癌症中,它们控制药物耐药、细胞存活和增殖等关键通路。scLong 通过捕获高低表达基因间的长程依赖,看到了更完整的调控图景。
2. GO知识增强:药物通常靶向特定细胞过程,GO让模型"预知"哪些基因在同一通路。即使表达数据稀疏,功能关系仍可引导模型识别有意义的交互。这使得scLong的表示具备归纳偏置,在数据有限时表现尤为突出。
3. 大规模预训练:4800万细胞的预训练让scLong学到了跨细胞类型和条件的泛化模式,这是GEARS等任务专用模型所不具备的。尤其在 Seen 0/2 等未见扰动场景中,预训练知识提供了关键的迁移能力。
此外,scLong 对零表达基因的建模也有独到见解:零表达可能是测序深度不足导致低表达未被检测到,也可能是该基因在特定细胞中确实沉默——两种情况都携带生物学信息,不应丢弃。
六、局限与展望
作者坦诚指出了scLong的局限:
计算门槛:十亿参数的架构对训练和推理都有较高硬件要求,可能限制资源有限团队的使用。
模型规模 vs 效率:虽然双Performer策略缓解了计算压力,但在28,000个基因上做自注意力的计算成本仍然显著高于仅处理2000个基因的模型。
尽管如此,scLong 的核心贡献——不放弃任何一个基因——为单细胞转录组学基础模型指明了新方向。在精准医学、药物发现和细胞生物学研究中,一个能看到"全局调控图景"的模型,其价值远超只看"高表达明星基因"的模型。
一句话总结:scLong 证明了当我们不再用"表达高低"来歧视基因,而是让所有基因参与自注意力、并注入功能知识时,单细胞转录组基础模型的理解能力可以跨越一个台阶。 论文信息 标题:scLong: a billion-parameter foundation model for capturing long-range gene context in single-cell transcriptomics 期刊:Nature Communications (2026) 17:2380 通讯作者:Pengtao Xie (UCSD), Eric Xing (MBZUAI/CMU) DOI:10.1038/s41467-026-69102-y


English

