碱基日读 每天读完真实文献,只讲有用的那一段

工具序列处理

FASTA 文件统计:序列数、长度分布与 N50

粘贴 multi-FASTA,立刻得到条数、总长、N50/L50、GC% 和长度分布。

拿到一份组装结果或一批序列,第一件事是看基本统计量

N50 是最常被误解的指标。定义是:把所有 contig 按长度从大到小排序,依次累加, 当累加长度首次达到总长度一半时,当前这条 contig 的长度就是 N50。 它衡量的是「组装的连续性」——N50 越大,说明长片段占的比重越高。

L50 是达到一半总长所需要的 contig 条数。N50 和 L50 是一对,方向相反。

要注意 N50 有个众所周知的缺陷:它对总长度敏感。如果组装漏掉了一大堆短 contig, 总长变小,N50 反而会变好看。所以 N50 必须和总长度、序列条数一起看,单独一个数没有意义。

本工具全部在浏览器内计算,序列不会上传。大文件建议先取子集。

常见问题

N50 越大越好吗?

在总长度和完整性相当的前提下才成立。N50 对总长敏感,丢掉大量短 contig 会让 N50 虚高,所以必须和总长、条数、BUSCO 完整度一起看。

能处理多大的文件?

受浏览器内存限制,几十 MB 的文本通常没问题,整个哺乳动物基因组建议在本地用命令行工具处理。

相关工具

蛋白质分子量、等电点与 280nm 消光系数在线计算

输入氨基酸序列,算出分子量、理论 pI、摩尔消光系数和 1 mg/mL 的 A280。

双序列比对在线工具(Needleman-Wunsch 全局比对)

两条序列全局比对,给出比对结果、得分、一致度与错配/空位统计。

密码子表速查(标准遗传密码):密码子与氨基酸双向查询

标准遗传密码全部 64 个密码子,支持密码子查氨基酸、氨基酸反查密码子,DNA 与 RNA 写法都认。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →