FASTA 文件统计:序列数、长度分布与 N50
拿到一份组装结果或一批序列,第一件事是看基本统计量。
N50 是最常被误解的指标。定义是:把所有 contig 按长度从大到小排序,依次累加, 当累加长度首次达到总长度一半时,当前这条 contig 的长度就是 N50。 它衡量的是「组装的连续性」——N50 越大,说明长片段占的比重越高。
L50 是达到一半总长所需要的 contig 条数。N50 和 L50 是一对,方向相反。
要注意 N50 有个众所周知的缺陷:它对总长度敏感。如果组装漏掉了一大堆短 contig, 总长变小,N50 反而会变好看。所以 N50 必须和总长度、序列条数一起看,单独一个数没有意义。
本工具全部在浏览器内计算,序列不会上传。大文件建议先取子集。
常见问题
N50 越大越好吗?
在总长度和完整性相当的前提下才成立。N50 对总长敏感,丢掉大量短 contig 会让 N50 虚高,所以必须和总长、条数、BUSCO 完整度一起看。
能处理多大的文件?
受浏览器内存限制,几十 MB 的文本通常没问题,整个哺乳动物基因组建议在本地用命令行工具处理。