从嗜碱细胞激活到矿化发育:单细胞算法如何在噪声中识别真实信号
单细胞测量有个长期存在的张力:要读细胞内部状态,传统方法往往要先裂解它,不裂解信号就弱、噪声就大。本周三篇文章分别从电生理、分子传感和转录组三个层面尝试绕开这个问题,武器不同,但共同目标是用计算方法从本就有限的单细胞信号里榨出更可靠的信息。
IFC 多频信号的拆分与重建
阻抗流式细胞术(impedance flow cytometry,IFC)天然无标记,细胞流过微流道时电阻抗变化就携带了生物物理信息,不需要荧光。代码多路复用(code-multiplexing)的思路是让多路信号共用同一套硬件采集,代价是叠加在一起,分解时需要额外的计算。现有方案依赖多个任务专用网络加模板线性拟合,在微流控里常见的非线性和不稳定条件下精度会明显下降,且只能处理单频阻抗(PMID: 42764344)。Lee 和 Tang 的方案是把连续干扰消除算法(successive interference cancellation,SIC)的迭代结构直接展开(unfold)成深度网络,每轮迭代对应网络的一个阶段,单个多任务网络重复执行信号估计和干扰消除。不预测波形幅度,而是预测每个事件的比特级强度和持续时间,这让网络对非线性信号拉伸有更强的鲁棒性。多频部分在预测出单频实阻抗轨迹之后,用最小二乘拟合推导其他频率的实部和虚部(PMID: 42764344)。
在细胞与微球混合评估数据集上,这条流程能可靠分解从单体到三联体的叠加,重建出的阻抗强度分布准确。应用于嗜碱细胞(basophil)激活检测时,阻抗不透明度(impedance opacity)与荧光流式的激活水平吻合,与此前研究一致(PMID: 42764344)。评估基于细胞与微球混合数据集,文中也自称“demonstration of principle”,嗜碱细胞是外周血里占比极低的稀有群体,选这个考题有意义,但从混合数据集到真实临床标本,中间距离仍然存在。
Apollo-IRE1 读取 IRE1 寡聚化的实时状态
胰腺 β 细胞因为高强度合成胰岛素,对内质网(endoplasmic reticulum,ER)折叠机器的依赖超过大多数细胞类型。一旦 ER 应激积累,IRE1 会从单体聚集成寡聚体,启动未折叠蛋白应答(unfolded protein response,UPR),这与 2 型糖尿病的发病机制相关。传统检测如 Western blot、RT-PCR 需要裂解细胞,只能给出时间点快照,追不了动态。
Apollo-IRE1 把荧光蛋白与 IRE1 融合表达,当两个融合分子足够近时发生同质 FRET(homoFRET),荧光各向异性(fluorescence anisotropy)随之下降。各向异性是一个比值,对激发光功率和探针浓度不敏感,日间重复性低,谱宽窄,能与其他荧光通道同步成像(PMID: 42765999)。做成像定量的人对这个工程细节会有感觉:基于强度的信号会因细胞厚度、表达量差异而漂移,比值信号不会,读出的状态更稳定,跨实验可比性更强。光漂白和增强曲线分析表明,传感器能区分表观单体(基线 ER 应激)、二聚体范围(中度应激)、高阶寡聚体(终末应激)三种状态(PMID: 42765999),化学诱导和生理性 ER 应激条件下均有响应,验证用了永生化 β 细胞系和小鼠初级胰岛细胞。
这是遗传编码传感器,前提是能把融合基因导入细胞,对不适合转染的原代类型不适用。验证数据来自小鼠胰岛,人 β 细胞是否行为一致,材料里没有回答。“表观”寡聚状态是从光学信号间接推断的,不等于直接测量了 IRE1 的物理聚集状态。
TrajDTW 整合 26 万细胞的骨与牙矿化轨迹
单细胞图谱(atlas)的基本逻辑是用静态快照重建动态过程,但来自不同实验室、不同平台的数据合并之后,哪些信号是真实的发育规律、哪些是技术噪声,很难分清。
Han 等人构建了牙齿发育单细胞图谱,整合来自 15 个项目的 261,929 个细胞,覆盖牙本质形成(odontogenesis)和牙釉质形成(amelogenesis)两个过程。他们开发的 TrajDTW 算法把动态时间规整(dynamic time warping,DTW)引入轨迹比较,在大规模跨数据集场景下寻找轨迹动态一致的基因。DTW 最早用于语音识别中对时间序列的对齐,放到这里的好处是能容忍不同项目因时间点设计不同带来的轨迹“拉伸”(PMID: 42766664)。
将牙齿图谱与已有骨图谱整合后,TrajDTW 识别出骨、牙釉质、牙本质三种硬组织矿化共享的分子通路。跨物种比较则发现了人与小鼠之间保守的间充质/成牙本质细胞(mesenchymal/odontoblast)程序(PMID: 42766664)。
这是观察性计算分析,没有功能验证。261,929 个细胞分散在 15 个项目里,各项目贡献量不均,整合时批次校正的效果从摘要无法评估。跨物种保守性的判断依赖人牙发育样本,而那本身就是极难获取的材料。说它“提供了前所未有的资源”,指的是数据规模和算法框架,因果机制还没到那一步。
三种路线的交叉点与各自的适用边界
这三篇文章的共同点,是都把算法设计视为单细胞测量精度的核心瓶颈,而不只是生物材料或硬件的问题。这一判断在当前单细胞领域相当有代表性。
差异同样重要。IFC 深度展开网络处理毫秒级电信号,通量高、无需标记,但只能读生物物理特性,看不见分子状态。Apollo-IRE1 则相反,追的是分子状态的实时动态,但需要遗传操作,目前验证场景集中在 β 细胞相关应激。TrajDTW 的思路又不一样,靠规模弥补单个测量的信噪比缺陷,覆盖发育时间尺度的转录变化,但轨迹永远是推断而非直接观察。
做免疫细胞功能筛选的人值得关注 IFC 多频扩展,不同频率下的阻抗反映不同细胞结构,多频并行测量意味着更丰富的表型向量,是实质性的信息增益。Apollo-IRE1 填了活细胞纵向监测 β 细胞 ER 应激的空白,能不能用于人 β 细胞是下一步要验证的。手头有多批 scRNA-seq 数据集需要整合的人,TrajDTW 提供了一个专门针对轨迹一致性的新算法思路,值得和现有的 Harmony、Seurat 整合框架放在同一个问题上对比。
- Code-multiplexed multi-frequency impedance cytometry with a unified deep-unfolding network.,Microsystems & nanoengineering(PMID: 42764344)
- Apollo-IRE1: A Genetically Encoded Sensor for Live Cell and Multiplexed Imaging of Endoplasmic Reticulum Stress.,ACS sensors(PMID: 42765999)
- Mapping a differentiation architecture for hard tissue mineralization with large-scale single-cell atlases.,PLoS computational biology(PMID: 42766664)