测序深度与数据量在线计算(Lander-Waterman)
测序深度(coverage / depth)的定义来自 Lander-Waterman 模型:
C = N × L / G
C:平均深度,写作 30×、100× 这样N:reads 条数L:读长(双端测序算两条链的总长,PE150 就是 300 bp)G:基因组(或目标区域)大小
反过来,要达到目标深度需要的数据量 = C × G,再除以读长就是 reads 条数。
这个模型的假设,以及它什么时候不成立:
Lander-Waterman 假设 reads 在基因组上均匀随机分布。真实数据里这个假设经常不成立:
- GC 偏好:极高或极低 GC 区域覆盖度显著偏低;
- 重复序列:多拷贝区域的 reads 无法唯一比对,有效深度低于平均值;
- 捕获测序:外显子组、panel 的 on-target 率通常只有 60–80%, 算数据量时必须把这个折扣算进去,否则实际深度会明显低于预期。
所以这里算出来的是理论平均深度。真实的均一性要看比对后的覆盖度分布, 而不是这个平均数。
常见问题
PE150 的读长填 150 还是 300?
填 300。双端测序一个 read pair 产生两条 150 bp 的序列,对基因组的覆盖贡献是 300 bp。
为什么实际深度比算的低?
捕获测序有 on-target 率折扣,还有重复 reads、低质量过滤的损耗。有效比例那一栏就是给这个用的。