单细胞扰动跨上下文预测、剪接体功能解析与卵巢早衰靶点发现同期解读
今天这三篇文章有一个共同底色:在单细胞分辨率上做「泛化」。扰动响应跨上下文迁移、剪接体功能的跨细胞类型预测、多组学信号压缩成可药性靶点,计算框架都很重,湿实验验证都很浅。这个落差值得在读完方法之后认真想一想。
scPILOT:用最优传输把扰动响应迁移到没见过的生物学上下文
王嘉亮等人提出 scPILOT(single-cell perturbation inference via latent optimal transport),目标是把「A 细胞里已知的药物扰动响应迁移到 B 细胞」这件事做成通用框架。核心思路两步:先用对抗训练(discriminator-assisted training)学出解耦的潜在表示,把「扰动效应」和「细胞上下文」分开编码;迁移时用潜在最优传输(latent optimal transport)把源上下文的响应分布映射到目标上下文(PMID: 42667121)。
基准测试覆盖三类跨上下文场景:跨细胞类型的 R²/MMD² 均值为 0.945/0.137,跨患者为 0.598/0.025,跨物种为 0.853/0.287。跨细胞类型 R² 接近 1 看起来漂亮,但跨患者只有 0.598,说明个体间异质性才是真正的瓶颈。补充分析表明,性能与「数据集可学习性」(dataset learnability)和「查询上下文匹配度」(query-context match)密切相关,也就是说方法在某些数据上会失效,而失效边界还没有明确量化(PMID: 42667121)。
这些数字全部来自计算基准,没有任何湿实验验证哪怕一个具体预测。如果你手头有多个批次或物种的单细胞扰动数据,scPILOT 提供了一个比简单批次校正更有理论支撑的迁移思路;做跨患者预测时要对 R² 打折扣,最好有独立数据集做验证再相信结论。
双队列蛋白质组学锁定卵巢早衰三个候选靶点
刘超等人整合了 deCODE(N = 35,559)和 UK Biobank(N = 54,219)两个独立蛋白质组学队列,用孟德尔随机化(Mendelian randomization)加贝叶斯共定位(Bayesian colocalization)加单细胞 RNA 测序三步走,筛卵巢早衰(premature ovarian insufficiency, POI)的因果蛋白靶点(PMID: 42663799)。
共识别出 7 个高置信靶点:EPHA4、FSTL3、NUCB2、OXT、SERPINA12、TNFRSF6B 和 FABP1。其中 EPHA4、FSTL3、NUCB2 在顺铂诱导的小鼠和人颗粒细胞模型中均显著异常表达(P < 0.05 至 P < 0.001),AUC 达 0.92–0.96,区分度相当高。分子对接显示 cycloheximide 与 EPHA4 的结合能为 -7.8 kcal/mol,分子动力学模拟的均方根偏差(RMSD)< 2.0 Å,结构稳定。富集分析提示纤维化、炎症和代谢失调参与 POI 发病机制(PMID: 42663799)。
孟德尔随机化在大队列里推断因果的能力比普通观察性研究强,两个独立队列互相复制也加分。但要注意:分子对接是纯计算结果,-7.8 kcal/mol 的结合能没有体外或体内活性数据支撑;顺铂诱导的颗粒细胞模型是化学损伤模型,不能完全等同于特发性 POI 的遗传发病机制;7 个靶点里有 4 个(OXT、SERPINA12、TNFRSF6B、FABP1)在功能实验层面基本空白。做卵巢功能或女性生育力研究的同行,EPHA4 和 FSTL3 值得优先关注,既有遗传因果证据,又有细胞模型数据,但从「计算预测」到「临床可用」,还需要独立队列复制和至少体外药效实验。
cIsoFun:多重异构网络预测细胞类型特异的剪接体功能
顾彤等人提出 cIsoFun,从单细胞转录组数据预测选择性剪接体(alternatively spliced isoform)的细胞类型特异功能。框架分三层:用预训练的 ESM-2 和 BERT 提取序列初始特征,构建覆盖基因、剪接体、GO 词条和细胞类型的多重异构网络(multiplex heterogeneous network),再通过关系感知注意力(relation-aware attention)融合多模态信息并细化节点嵌入,最终用多分量损失优化 GO 功能预测(PMID: 42664103)。
与已有方法相比,cIsoFun 表现更好,稀疏 GO 词条上的优势更明显。细胞类型特异分析揭示了有意思的功能分化:肾肿瘤细胞富集代谢和生长调控相关剪接体功能,皮肤肿瘤细胞侧重免疫监视和迁移,细胞系则优先 DNA 损伤修复和端粒维护。对序列各区段贡献的分析还发现,注释为相同功能的结构域在不同剪接体中的贡献分布存在差异(PMID: 42664103)。代码和数据已开放,可复现性有保证。
ESM-2 加图网络的组合技术上并不新鲜,胜在对单细胞上下文的整合比较系统。「优于现有方法」的具体比较基准没在摘要中详细说明,需要看正文附图才能判断差距大小。细胞类型特异的功能富集结论目前只来自计算预测,没有剪接体水平的实验功能验证。做肿瘤单细胞或发育生物学的同行,cIsoFun 提供了一个把「基因级表达」往下钻到「剪接体级功能」的计算入口,稀有 GO 功能注释场景下提升更明显,建议先在自己熟悉的细胞类型上跑一遍,验证预测结果是否生物学合理,再用于指导实验。
三项研究共享的方法边界
计算精致、验证偏浅,是这三项工作共同的短板。scPILOT 跨患者 R² 只有 0.598,泛化远未完美,且没有任何实验干预验证(PMID: 42667121);POI 靶点研究 7 个候选中只有 3 个进入细胞模型,分子对接结论完全没有体外活性数据支撑(PMID: 42663799);cIsoFun 的细胞类型功能富集全来自预测,没有剪接体层面的实验验证(PMID: 42664103)。
外推边界同样值得认清。scPILOT 自己承认性能与「可学习性」挂钩,意味着在低质量或小样本数据上容易失效;POI 研究的细胞模型是顺铂化学损伤,和特发性 POI 的遗传背景不完全对应。把计算结论变成实验立项之前,最好先做一轮独立数据的方法验证。
- Predicting Single-Cell Perturbation Responses Across Biological Contexts With a Deep Generative Model Integrating Optimal Transport.,Advanced science (Weinheim, Baden-Wurttemberg, Germany)(PMID: 42667121)
- Identifying novel druggable targets and repurposable drugs for premature ovarian insufficiency by integrated multiomics and causal inference analysis.,GeroScience(PMID: 42663799)
- Cell Type-specific Isoform Function Prediction by Multiplex Heterogeneous Network.,IEEE transactions on computational biology and bioinformatics(PMID: 42664103)