碱基日读 每天读完真实文献,只讲有用的那一段

工具统计分析

测序深度与数据量在线计算(Lander-Waterman)

在测序深度、reads 数、数据量与基因组大小之间双向换算。

测序深度(coverage / depth)的定义来自 Lander-Waterman 模型:

C = N × L / G

反过来,要达到目标深度需要的数据量 = C × G,再除以读长就是 reads 条数。

这个模型的假设,以及它什么时候不成立:

Lander-Waterman 假设 reads 在基因组上均匀随机分布。真实数据里这个假设经常不成立:

所以这里算出来的是理论平均深度。真实的均一性要看比对后的覆盖度分布, 而不是这个平均数。

常见问题

PE150 的读长填 150 还是 300?

填 300。双端测序一个 read pair 产生两条 150 bp 的序列,对基因组的覆盖贡献是 300 bp。

为什么实际深度比算的低?

捕获测序有 on-target 率折扣,还有重复 reads、低质量过滤的损耗。有效比例那一栏就是给这个用的。

相关工具

两组比较样本量估算(t 检验 / 比例检验)

按效应量、显著性水平与把握度,估算每组需要多少样本。

群落多样性指数在线计算(Shannon / Simpson / Chao1)

粘贴物种丰度表,算出 Shannon、Simpson、均匀度与 Chao1 丰富度估计。

富集显著性检验在线计算(超几何分布 / Fisher 精确检验)

输入背景基因数、通路基因数、列表长度与重叠数,算出 p 值、富集倍数与期望重叠。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →