碱基日读 每天读完真实文献,只讲有用的那一段

单细胞扰动跨上下文预测、剪接体功能解析与卵巢早衰靶点发现同期解读

2026-08-30·碱基·生信方法

要点 三款工具计算框架精巧,但从预测结论到实验落地,验证环节普遍缺位。

今天这三篇文章有一个共同底色:在单细胞分辨率上做「泛化」。扰动响应跨上下文迁移、剪接体功能的跨细胞类型预测、多组学信号压缩成可药性靶点,计算框架都很重,湿实验验证都很浅。这个落差值得在读完方法之后认真想一想。

scPILOT:用最优传输把扰动响应迁移到没见过的生物学上下文

王嘉亮等人提出 scPILOT(single-cell perturbation inference via latent optimal transport),目标是把「A 细胞里已知的药物扰动响应迁移到 B 细胞」这件事做成通用框架。核心思路两步:先用对抗训练(discriminator-assisted training)学出解耦的潜在表示,把「扰动效应」和「细胞上下文」分开编码;迁移时用潜在最优传输(latent optimal transport)把源上下文的响应分布映射到目标上下文(PMID: 42667121)。

基准测试覆盖三类跨上下文场景:跨细胞类型的 R²/MMD² 均值为 0.945/0.137,跨患者为 0.598/0.025,跨物种为 0.853/0.287。跨细胞类型 R² 接近 1 看起来漂亮,但跨患者只有 0.598,说明个体间异质性才是真正的瓶颈。补充分析表明,性能与「数据集可学习性」(dataset learnability)和「查询上下文匹配度」(query-context match)密切相关,也就是说方法在某些数据上会失效,而失效边界还没有明确量化(PMID: 42667121)。

这些数字全部来自计算基准,没有任何湿实验验证哪怕一个具体预测。如果你手头有多个批次或物种的单细胞扰动数据,scPILOT 提供了一个比简单批次校正更有理论支撑的迁移思路;做跨患者预测时要对 R² 打折扣,最好有独立数据集做验证再相信结论。

双队列蛋白质组学锁定卵巢早衰三个候选靶点

刘超等人整合了 deCODE(N = 35,559)和 UK Biobank(N = 54,219)两个独立蛋白质组学队列,用孟德尔随机化(Mendelian randomization)加贝叶斯共定位(Bayesian colocalization)加单细胞 RNA 测序三步走,筛卵巢早衰(premature ovarian insufficiency, POI)的因果蛋白靶点(PMID: 42663799)。

共识别出 7 个高置信靶点:EPHA4、FSTL3、NUCB2、OXT、SERPINA12、TNFRSF6B 和 FABP1。其中 EPHA4、FSTL3、NUCB2 在顺铂诱导的小鼠和人颗粒细胞模型中均显著异常表达(P < 0.05 至 P < 0.001),AUC 达 0.92–0.96,区分度相当高。分子对接显示 cycloheximide 与 EPHA4 的结合能为 -7.8 kcal/mol,分子动力学模拟的均方根偏差(RMSD)< 2.0 Å,结构稳定。富集分析提示纤维化、炎症和代谢失调参与 POI 发病机制(PMID: 42663799)。

孟德尔随机化在大队列里推断因果的能力比普通观察性研究强,两个独立队列互相复制也加分。但要注意:分子对接是纯计算结果,-7.8 kcal/mol 的结合能没有体外或体内活性数据支撑;顺铂诱导的颗粒细胞模型是化学损伤模型,不能完全等同于特发性 POI 的遗传发病机制;7 个靶点里有 4 个(OXT、SERPINA12、TNFRSF6B、FABP1)在功能实验层面基本空白。做卵巢功能或女性生育力研究的同行,EPHA4 和 FSTL3 值得优先关注,既有遗传因果证据,又有细胞模型数据,但从「计算预测」到「临床可用」,还需要独立队列复制和至少体外药效实验。

cIsoFun:多重异构网络预测细胞类型特异的剪接体功能

顾彤等人提出 cIsoFun,从单细胞转录组数据预测选择性剪接体(alternatively spliced isoform)的细胞类型特异功能。框架分三层:用预训练的 ESM-2 和 BERT 提取序列初始特征,构建覆盖基因、剪接体、GO 词条和细胞类型的多重异构网络(multiplex heterogeneous network),再通过关系感知注意力(relation-aware attention)融合多模态信息并细化节点嵌入,最终用多分量损失优化 GO 功能预测(PMID: 42664103)。

与已有方法相比,cIsoFun 表现更好,稀疏 GO 词条上的优势更明显。细胞类型特异分析揭示了有意思的功能分化:肾肿瘤细胞富集代谢和生长调控相关剪接体功能,皮肤肿瘤细胞侧重免疫监视和迁移,细胞系则优先 DNA 损伤修复和端粒维护。对序列各区段贡献的分析还发现,注释为相同功能的结构域在不同剪接体中的贡献分布存在差异(PMID: 42664103)。代码和数据已开放,可复现性有保证。

ESM-2 加图网络的组合技术上并不新鲜,胜在对单细胞上下文的整合比较系统。「优于现有方法」的具体比较基准没在摘要中详细说明,需要看正文附图才能判断差距大小。细胞类型特异的功能富集结论目前只来自计算预测,没有剪接体水平的实验功能验证。做肿瘤单细胞或发育生物学的同行,cIsoFun 提供了一个把「基因级表达」往下钻到「剪接体级功能」的计算入口,稀有 GO 功能注释场景下提升更明显,建议先在自己熟悉的细胞类型上跑一遍,验证预测结果是否生物学合理,再用于指导实验。

三项研究共享的方法边界

计算精致、验证偏浅,是这三项工作共同的短板。scPILOT 跨患者 R² 只有 0.598,泛化远未完美,且没有任何实验干预验证(PMID: 42667121);POI 靶点研究 7 个候选中只有 3 个进入细胞模型,分子对接结论完全没有体外活性数据支撑(PMID: 42663799);cIsoFun 的细胞类型功能富集全来自预测,没有剪接体层面的实验验证(PMID: 42664103)。

外推边界同样值得认清。scPILOT 自己承认性能与「可学习性」挂钩,意味着在低质量或小样本数据上容易失效;POI 研究的细胞模型是顺铂化学损伤,和特发性 POI 的遗传背景不完全对应。把计算结论变成实验立项之前,最好先做一轮独立数据的方法验证。

单细胞生物信息扰动响应预测卵巢早衰靶点剪接体功能注释多组学因果推断

同主题文章

相关工具

多重检验校正在线计算:BH (FDR)、BY 与 Bonferroni

粘贴一列 p 值,一次得到 BH 的 q 值、BY 与 Bonferroni 校正值,三者并列对照。

log2FC 与倍数变化 (Fold Change) 在线互转

log2FC ↔ 倍数、上调下调百分比,附常用阈值对照表。

基因列表交集并集差集在线计算(Venn 集合运算)

粘贴 2–3 组基因/ID 列表,一键得到交集、并集、各自独有,含去重与大小写归一。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →