碱基日读 每天读完真实文献,只讲有用的那一段

工具序列处理

密码子偏好性表与稀有密码子扫描(含 CAI 计算)

九个常用物种的密码子使用频率,粘贴 CDS 即可扫描稀有密码子、算 CAI,并给出每个氨基酸在该宿主里的最优密码子。

九个常用物种的密码子使用频率,以及一个稀有密码子扫描框: 粘贴 CDS 序列、选好表达宿主,直接看出哪些位置会拖慢翻译。

收录的物种与样本量

物种 CDS 数 密码子总数 是否可靠
大肠杆菌 W3110
Escherichia coli W3110
4,332 1,372,057

Homo sapiens
93,487 40,662,582
小鼠
Mus musculus
53,036 24,533,776
酿酒酵母
Saccharomyces cerevisiae
14,411 6,534,504
CHO 细胞(中国仓鼠)
Cricetulus griseus
331 153,527 ⚠ 样本偏小
果蝇
Drosophila melanogaster
42,417 21,945,319
线虫
Caenorhabditis elegans
24,994 11,197,796
斑马鱼
Danio rerio
19,062 8,042,248
拟南芥
Arabidopsis thaliana
80,395 31,098,475

大肠杆菌 W3110 密码子使用频率

氨基酸 密码子 占比 每千密码子 该家族最优
终止 TAA 0.64 2.0
终止 TAG 0.07 0.2
终止 TGA 0.29 0.9
A GCA 0.21 20.1
A GCC 0.27 25.7
A GCG 0.36 33.9
A GCT 0.16 15.2
C TGC 0.56 6.4
C TGT 0.44 5.1
D GAC 0.37 19.1
D GAT 0.63 32.2
E GAA 0.69 39.7
E GAG 0.31 18.0
F TTC 0.43 16.5
F TTT 0.57 22.2
G GGA 0.11 7.9
G GGC 0.41 29.8
G GGG 0.15 11.0
G GGT 0.34 24.7
H CAC 0.43 9.8
H CAT 0.57 13.0
I ATA 0.07 4.2
I ATC 0.42 25.2
I ATT 0.51 30.4
K AAA 0.76 33.6
K AAG 0.24 10.3
L CTA 0.04 3.8
L CTC 0.10 11.1
L CTG 0.50 53.1
L CTT 0.10 11.0
L TTA 0.13 13.8
L TTG 0.13 13.6
M ATG 1.00 27.8
N AAC 0.55 21.6
N AAT 0.45 17.6
P CCA 0.19 8.4
P CCC 0.12 5.5
P CCG 0.53 23.4
P CCT 0.16 7.0
Q CAA 0.35 15.4
Q CAG 0.65 29.0
R AGA 0.04 2.0
R AGG 0.02 1.1
R CGA 0.06 3.5
R CGC 0.40 22.3
R CGG 0.10 5.4
R CGT 0.38 21.0
S AGC 0.28 16.1
S AGT 0.15 8.7
S TCA 0.12 7.0
S TCC 0.15 8.6
S TCG 0.15 8.9
S TCT 0.15 8.4
T ACA 0.13 6.9
T ACC 0.44 23.5
T ACG 0.27 14.4
T ACT 0.16 8.8
V GTA 0.15 10.9
V GTC 0.22 15.3
V GTG 0.37 26.3
V GTT 0.26 18.2
W TGG 1.00 15.2
Y TAC 0.43 12.2
Y TAT 0.57 16.1

人(Homo sapiens)密码子使用频率

氨基酸 密码子 占比 每千密码子 该家族最优
终止 TAA 0.30 1.0
终止 TAG 0.24 0.8
终止 TGA 0.47 1.6
A GCA 0.23 15.8
A GCC 0.40 27.7
A GCG 0.11 7.4
A GCT 0.27 18.4
C TGC 0.54 12.6
C TGT 0.46 10.6
D GAC 0.54 25.1
D GAT 0.46 21.8
E GAA 0.42 29.0
E GAG 0.58 39.6
F TTC 0.54 20.3
F TTT 0.46 17.6
G GGA 0.25 16.5
G GGC 0.34 22.2
G GGG 0.25 16.5
G GGT 0.16 10.8
H CAC 0.58 15.1
H CAT 0.42 10.9
I ATA 0.17 7.5
I ATC 0.47 20.8
I ATT 0.36 16.0
K AAA 0.43 24.4
K AAG 0.57 31.9
L CTA 0.07 7.2
L CTC 0.20 19.6
L CTG 0.40 39.6
L CTT 0.13 13.2
L TTA 0.08 7.7
L TTG 0.13 12.9
M ATG 1.00 22.0
N AAC 0.53 19.1
N AAT 0.47 17.0
P CCA 0.28 16.9
P CCC 0.32 19.8
P CCG 0.11 6.9
P CCT 0.29 17.5
Q CAA 0.27 12.3
Q CAG 0.73 34.2
R AGA 0.21 12.2
R AGG 0.21 12.0
R CGA 0.11 6.2
R CGC 0.18 10.4
R CGG 0.20 11.4
R CGT 0.08 4.5
S AGC 0.24 19.5
S AGT 0.15 12.1
S TCA 0.15 12.2
S TCC 0.22 17.7
S TCG 0.05 4.4
S TCT 0.19 15.2
T ACA 0.28 15.1
T ACC 0.36 18.9
T ACG 0.11 6.1
T ACT 0.25 13.1
V GTA 0.12 7.1
V GTC 0.24 14.5
V GTG 0.46 28.1
V GTT 0.18 11.0
W TGG 1.00 13.2
Y TAC 0.56 15.3
Y TAT 0.44 12.2

先看样本量,再看数字

这是本页最想说的一件事。 密码子偏好性表是从一批基因统计出来的, 统计的基因越少,表越不可信。而多数密码子偏好性页面只给数字,不给样本量。

Kazusa 数据库里「Escherichia coli K12」那条记录只有 14 个 CDS。 大肠杆菌恰恰是密码子优化最常用的宿主,拿 14 个基因统计出来的表去优化一条基因, 等于用三个人的身高推断一个国家。本页用的是 W3110(4332 个 CDS), K-12 系的标准实验室菌株,基因组级覆盖。

上面的表里每个物种都标了 CDS 数,少于 1000 的会打上「样本偏小」—— CHO 细胞只有 331 个 CDS,虽然它是蛋白表达的常用宿主,用之前得知道这一点。

稀有密码子为什么要紧

同义密码子对应的 tRNA 丰度差别很大。序列里连续出现宿主的稀有密码子时, 核糖体会在那里停顿,可能导致产量下降、提前终止或移码。 异源表达失败最常见的原因之一就是把富含 AGA/AGG(大肠杆菌里的稀有精氨酸密码子) 的真核基因直接塞进大肠杆菌。

扫描框会标出占比低于 0.10 的密码子,并给出该氨基酸在宿主里的最优密码子。

关于 CAI

CAI(Codon Adaptation Index)由 Sharp 与 Li 提出(Nucleic Acids Res. 1987;15(3):1281–1295), 定义是各密码子「相对适应度」w 的几何平均,w 为该密码子的使用频率除以同一氨基酸家族中 最常用密码子的频率。CAI 越接近 1,说明这条序列的用法越贴近宿主偏好。

必须说清楚一处差别: Sharp 与 Li 原文用的是高表达基因参考集来计算 w, 而本页用的是全基因组平均。这是常见的简化做法,但数值会与基于高表达集的 CAI 有系统差异, 不能直接和文献里的 CAI 数值比较。它适合做同一宿主下不同序列版本之间的横向比较。

计算时排除甲硫氨酸、色氨酸(各只有一个密码子,w 恒为 1)和终止密码子。

常见问题

为什么不用 Kazusa 里那条「Escherichia coli K12」?

因为它只有 14 个 CDS。密码子偏好性是统计量,14 个基因统计不出可靠的分布。本页用的是 W3110(4332 个 CDS),K-12 系的标准实验室菌株,基因组级覆盖。看密码子表时第一件事应该是看它基于多少条序列——多数页面不告诉你这个数。

这里算的 CAI 能直接和论文里的比吗?

不能。Sharp 与 Li 的原始定义用高表达基因参考集计算相对适应度 w,本页用的是全基因组平均。这是常见简化,但数值会有系统差异。它适合做同一宿主下不同序列版本之间的横向比较,不适合跨文献比数值。

稀有密码子阈值填多少合适?

默认 0.10 是常用起点。真正要紧的不是单个稀有密码子,而是它们**连成一串**——分散出现通常无碍,连续出现才容易造成核糖体停顿。扫描结果会单独指出相邻的情况。

把稀有密码子全换掉就能提高表达量吗?

不一定。密码子优化只解决翻译速率这一层,而表达失败还可能来自 mRNA 5′ 端二级结构、稀有 tRNA 池耗竭、蛋白折叠或毒性。另外过度优化(全部换成最优密码子)有时反而降低可溶性,因为翻译过快会打乱共翻译折叠的节奏。

CHO 细胞的数据可靠吗?

CHO(中国仓鼠)在 Kazusa 里只有 331 个 CDS,本页标了「样本偏小」。它是蛋白表达的常用宿主所以收录了,但数值的置信度明显低于人和小鼠,用时要知道这一点。

相关工具

DNA / RNA 反向互补序列在线转换

粘贴序列即得反向互补、互补、反向三种结果,支持 FASTA 与 IUPAC 简并碱基。

DNA 序列 GC 含量与 Tm 值在线计算

计算 GC%、碱基组成、分子量与两种经验 Tm,适合快速检查引物。

DNA 序列翻译成蛋白质(六框翻译)在线工具

标准遗传密码表,支持单框与六框翻译、ORF 查找。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →