细胞丰度变化会伪装成通讯上调,单细胞差异分析绕不开这层混淆
单细胞通讯分析里有一个不太显眼的坑。当比较两组样本时,如果疾病组某类细胞的比例升高了,涉及这类细胞的配体-受体互作分数几乎必然跟着升高,哪怕每个细胞的表达量一点没变。这不是信号增强,是组成混淆(compositional confounding)。把这两件事分开,是差异通讯分析得出可信结论的前提。
通讯信号的三个独立分量
Community 是专为多样本病例-对照 scRNAseq 数据集设计的差异通讯分析 R 包(PMID: 42699773)。它把一条通讯链路显式分解为三个独立分量:细胞类型丰度(abundance)、参与信号传导的细胞活跃分数(active fraction),以及配体-受体表达水平。三者各自独立评估,通讯模式可以被归类为上调、下调、不变,或“补偿性”(compensated,指某个分量下降而另一个上升、整体效果相互抵消)。
作者把这套框架用在三个疾病场景上:溃疡性结肠炎、接受免疫检查点抑制剂治疗的黑色素瘤,以及急性髓系白血病(AML)。溃疡性结肠炎中通讯整体增加,黑色素瘤应答者中免疫抑制信号减弱,AML 中免疫通讯整体下降(PMID: 42699773)。与现有工具相比,Community 对离群样本驱动的噪声更稳健、扩展性更好。三个场景用的是已发表的公开数据集,各自样本量有限,这套分解方法在其他组织系统上的表现还需要独立验证。
植物单细胞标记的置信度分层
同样的混淆,在跨数据集整合时以另一种形式出现。一个基因在特定实验背景下是好标记,换一批参照细胞,特异性就可能消失。
iPscDB 整合了来自 38 个植物物种、946 个实验的 4,688,428 个细胞,以及 288,139 个经人工整理的细胞标记(PMID: 42755294)。在这个规模下,标记可信度的差异是必然存在的。平台引入了“标记置信度分级”(Marker Confidence Level)体系,按证据强度和独立性给每个标记评级,从人工整理的经典标记到数据库来源的关联,分级明确。原始数据可及的数据集经统一流水线重处理,整合质量和自动化细胞类型注释都做了定量评估。
没有原始数据的实验集只能沿用原始注释,这是任何大型整合数据库都面临的上限,iPscDB 也不例外(PMID: 42755294)。分级体系至少让用户知道一个标记的证据来自哪里,而不是拿到一张列表然后不知道哪条更可信。
iGCB 的体外诱导与前体限制
如果组成混淆来自组织背景,最彻底的解法是把细胞从组织里拿出来。
生发中心 B 细胞(germinal center B cells,GCB)是抗体亲和力成熟和体细胞高频突变(somatic hypermutation,SHM)的核心场所,但它们定位于淋巴组织,一直很难在人体材料上做实验操作。Priest 等人描述了一种体外诱导体系,通过模拟 T 细胞来源的信号,把人类初始 B 细胞转化为 BCL6 阳性的诱导 GCB 样细胞(iGCB)(PMID: 42758797)。验证依靠单细胞蛋白质组和转录组的并排比较,iGCB 细胞在表面标记、转录因子、DNA 修复和糖基化特征上与人扁桃体 GCB 细胞吻合,且存在激活诱导胞苷脱氨酶(AID)依赖的 SHM。
iGCB 细胞可以从初始 B 细胞和未类别转换的记忆 B 细胞及循环边缘区 B 细胞生成,但不能从类别转换的记忆 B 细胞生成(PMID: 42758797)。这个前体限制本身就是一条关于 GCB 诱导条件的具体线索。体外体系成立的前提是 iGCB 与体内 GCB 足够相似,单细胞多组学的并排分析提供了这一证据,但两者在更复杂功能实验中的等价性还需要逐步建立。
三篇工作横跨人类淋巴组织、植物基因组、炎症和肿瘤免疫,研究对象相距很远,但碰到的是同一类问题:把叠加在一起的信号层拆开。这不是技巧,是让结论成立的前提。
- Community: Component based differential cell communication analysis in large multi-sample case-control scRNAseq datasets.,iScience(PMID: 42699773)
- iPscDB: a comprehensive platform for plant single-cell transcriptomic data integration and analysis.,Nucleic acids research(PMID: 42755294)
- In vitro induction of human germinal center B cells.,Science immunology(PMID: 42758797)