密码子偏好性表与稀有密码子扫描(含 CAI 计算)
九个常用物种的密码子使用频率,以及一个稀有密码子扫描框: 粘贴 CDS 序列、选好表达宿主,直接看出哪些位置会拖慢翻译。
收录的物种与样本量
| 物种 | CDS 数 | 密码子总数 | 是否可靠 |
|---|---|---|---|
| 大肠杆菌 W3110 Escherichia coli W3110 |
4,332 | 1,372,057 | ✓ |
| 人 Homo sapiens |
93,487 | 40,662,582 | ✓ |
| 小鼠 Mus musculus |
53,036 | 24,533,776 | ✓ |
| 酿酒酵母 Saccharomyces cerevisiae |
14,411 | 6,534,504 | ✓ |
| CHO 细胞(中国仓鼠) Cricetulus griseus |
331 | 153,527 | ⚠ 样本偏小 |
| 果蝇 Drosophila melanogaster |
42,417 | 21,945,319 | ✓ |
| 线虫 Caenorhabditis elegans |
24,994 | 11,197,796 | ✓ |
| 斑马鱼 Danio rerio |
19,062 | 8,042,248 | ✓ |
| 拟南芥 Arabidopsis thaliana |
80,395 | 31,098,475 | ✓ |
大肠杆菌 W3110 密码子使用频率
| 氨基酸 | 密码子 | 占比 | 每千密码子 | 该家族最优 |
|---|---|---|---|---|
| 终止 | TAA |
0.64 | 2.0 | ★ |
| 终止 | TAG |
0.07 | 0.2 | |
| 终止 | TGA |
0.29 | 0.9 | |
| A | GCA |
0.21 | 20.1 | |
| A | GCC |
0.27 | 25.7 | |
| A | GCG |
0.36 | 33.9 | ★ |
| A | GCT |
0.16 | 15.2 | |
| C | TGC |
0.56 | 6.4 | ★ |
| C | TGT |
0.44 | 5.1 | |
| D | GAC |
0.37 | 19.1 | |
| D | GAT |
0.63 | 32.2 | ★ |
| E | GAA |
0.69 | 39.7 | ★ |
| E | GAG |
0.31 | 18.0 | |
| F | TTC |
0.43 | 16.5 | |
| F | TTT |
0.57 | 22.2 | ★ |
| G | GGA |
0.11 | 7.9 | |
| G | GGC |
0.41 | 29.8 | ★ |
| G | GGG |
0.15 | 11.0 | |
| G | GGT |
0.34 | 24.7 | |
| H | CAC |
0.43 | 9.8 | |
| H | CAT |
0.57 | 13.0 | ★ |
| I | ATA |
0.07 | 4.2 | |
| I | ATC |
0.42 | 25.2 | |
| I | ATT |
0.51 | 30.4 | ★ |
| K | AAA |
0.76 | 33.6 | ★ |
| K | AAG |
0.24 | 10.3 | |
| L | CTA |
0.04 | 3.8 | |
| L | CTC |
0.10 | 11.1 | |
| L | CTG |
0.50 | 53.1 | ★ |
| L | CTT |
0.10 | 11.0 | |
| L | TTA |
0.13 | 13.8 | |
| L | TTG |
0.13 | 13.6 | |
| M | ATG |
1.00 | 27.8 | ★ |
| N | AAC |
0.55 | 21.6 | ★ |
| N | AAT |
0.45 | 17.6 | |
| P | CCA |
0.19 | 8.4 | |
| P | CCC |
0.12 | 5.5 | |
| P | CCG |
0.53 | 23.4 | ★ |
| P | CCT |
0.16 | 7.0 | |
| Q | CAA |
0.35 | 15.4 | |
| Q | CAG |
0.65 | 29.0 | ★ |
| R | AGA |
0.04 | 2.0 | |
| R | AGG |
0.02 | 1.1 | |
| R | CGA |
0.06 | 3.5 | |
| R | CGC |
0.40 | 22.3 | ★ |
| R | CGG |
0.10 | 5.4 | |
| R | CGT |
0.38 | 21.0 | |
| S | AGC |
0.28 | 16.1 | ★ |
| S | AGT |
0.15 | 8.7 | |
| S | TCA |
0.12 | 7.0 | |
| S | TCC |
0.15 | 8.6 | |
| S | TCG |
0.15 | 8.9 | |
| S | TCT |
0.15 | 8.4 | |
| T | ACA |
0.13 | 6.9 | |
| T | ACC |
0.44 | 23.5 | ★ |
| T | ACG |
0.27 | 14.4 | |
| T | ACT |
0.16 | 8.8 | |
| V | GTA |
0.15 | 10.9 | |
| V | GTC |
0.22 | 15.3 | |
| V | GTG |
0.37 | 26.3 | ★ |
| V | GTT |
0.26 | 18.2 | |
| W | TGG |
1.00 | 15.2 | ★ |
| Y | TAC |
0.43 | 12.2 | |
| Y | TAT |
0.57 | 16.1 | ★ |
人(Homo sapiens)密码子使用频率
| 氨基酸 | 密码子 | 占比 | 每千密码子 | 该家族最优 |
|---|---|---|---|---|
| 终止 | TAA |
0.30 | 1.0 | |
| 终止 | TAG |
0.24 | 0.8 | |
| 终止 | TGA |
0.47 | 1.6 | ★ |
| A | GCA |
0.23 | 15.8 | |
| A | GCC |
0.40 | 27.7 | ★ |
| A | GCG |
0.11 | 7.4 | |
| A | GCT |
0.27 | 18.4 | |
| C | TGC |
0.54 | 12.6 | ★ |
| C | TGT |
0.46 | 10.6 | |
| D | GAC |
0.54 | 25.1 | ★ |
| D | GAT |
0.46 | 21.8 | |
| E | GAA |
0.42 | 29.0 | |
| E | GAG |
0.58 | 39.6 | ★ |
| F | TTC |
0.54 | 20.3 | ★ |
| F | TTT |
0.46 | 17.6 | |
| G | GGA |
0.25 | 16.5 | |
| G | GGC |
0.34 | 22.2 | ★ |
| G | GGG |
0.25 | 16.5 | |
| G | GGT |
0.16 | 10.8 | |
| H | CAC |
0.58 | 15.1 | ★ |
| H | CAT |
0.42 | 10.9 | |
| I | ATA |
0.17 | 7.5 | |
| I | ATC |
0.47 | 20.8 | ★ |
| I | ATT |
0.36 | 16.0 | |
| K | AAA |
0.43 | 24.4 | |
| K | AAG |
0.57 | 31.9 | ★ |
| L | CTA |
0.07 | 7.2 | |
| L | CTC |
0.20 | 19.6 | |
| L | CTG |
0.40 | 39.6 | ★ |
| L | CTT |
0.13 | 13.2 | |
| L | TTA |
0.08 | 7.7 | |
| L | TTG |
0.13 | 12.9 | |
| M | ATG |
1.00 | 22.0 | ★ |
| N | AAC |
0.53 | 19.1 | ★ |
| N | AAT |
0.47 | 17.0 | |
| P | CCA |
0.28 | 16.9 | |
| P | CCC |
0.32 | 19.8 | ★ |
| P | CCG |
0.11 | 6.9 | |
| P | CCT |
0.29 | 17.5 | |
| Q | CAA |
0.27 | 12.3 | |
| Q | CAG |
0.73 | 34.2 | ★ |
| R | AGA |
0.21 | 12.2 | ★ |
| R | AGG |
0.21 | 12.0 | |
| R | CGA |
0.11 | 6.2 | |
| R | CGC |
0.18 | 10.4 | |
| R | CGG |
0.20 | 11.4 | |
| R | CGT |
0.08 | 4.5 | |
| S | AGC |
0.24 | 19.5 | ★ |
| S | AGT |
0.15 | 12.1 | |
| S | TCA |
0.15 | 12.2 | |
| S | TCC |
0.22 | 17.7 | |
| S | TCG |
0.05 | 4.4 | |
| S | TCT |
0.19 | 15.2 | |
| T | ACA |
0.28 | 15.1 | |
| T | ACC |
0.36 | 18.9 | ★ |
| T | ACG |
0.11 | 6.1 | |
| T | ACT |
0.25 | 13.1 | |
| V | GTA |
0.12 | 7.1 | |
| V | GTC |
0.24 | 14.5 | |
| V | GTG |
0.46 | 28.1 | ★ |
| V | GTT |
0.18 | 11.0 | |
| W | TGG |
1.00 | 13.2 | ★ |
| Y | TAC |
0.56 | 15.3 | ★ |
| Y | TAT |
0.44 | 12.2 |
先看样本量,再看数字
这是本页最想说的一件事。 密码子偏好性表是从一批基因统计出来的, 统计的基因越少,表越不可信。而多数密码子偏好性页面只给数字,不给样本量。
Kazusa 数据库里「Escherichia coli K12」那条记录只有 14 个 CDS。 大肠杆菌恰恰是密码子优化最常用的宿主,拿 14 个基因统计出来的表去优化一条基因, 等于用三个人的身高推断一个国家。本页用的是 W3110(4332 个 CDS), K-12 系的标准实验室菌株,基因组级覆盖。
上面的表里每个物种都标了 CDS 数,少于 1000 的会打上「样本偏小」—— CHO 细胞只有 331 个 CDS,虽然它是蛋白表达的常用宿主,用之前得知道这一点。
稀有密码子为什么要紧
同义密码子对应的 tRNA 丰度差别很大。序列里连续出现宿主的稀有密码子时, 核糖体会在那里停顿,可能导致产量下降、提前终止或移码。 异源表达失败最常见的原因之一就是把富含 AGA/AGG(大肠杆菌里的稀有精氨酸密码子) 的真核基因直接塞进大肠杆菌。
扫描框会标出占比低于 0.10 的密码子,并给出该氨基酸在宿主里的最优密码子。
关于 CAI
CAI(Codon Adaptation Index)由 Sharp 与 Li 提出(Nucleic Acids Res. 1987;15(3):1281–1295), 定义是各密码子「相对适应度」w 的几何平均,w 为该密码子的使用频率除以同一氨基酸家族中 最常用密码子的频率。CAI 越接近 1,说明这条序列的用法越贴近宿主偏好。
必须说清楚一处差别: Sharp 与 Li 原文用的是高表达基因参考集来计算 w, 而本页用的是全基因组平均。这是常见的简化做法,但数值会与基于高表达集的 CAI 有系统差异, 不能直接和文献里的 CAI 数值比较。它适合做同一宿主下不同序列版本之间的横向比较。
计算时排除甲硫氨酸、色氨酸(各只有一个密码子,w 恒为 1)和终止密码子。
常见问题
为什么不用 Kazusa 里那条「Escherichia coli K12」?
因为它只有 14 个 CDS。密码子偏好性是统计量,14 个基因统计不出可靠的分布。本页用的是 W3110(4332 个 CDS),K-12 系的标准实验室菌株,基因组级覆盖。看密码子表时第一件事应该是看它基于多少条序列——多数页面不告诉你这个数。
这里算的 CAI 能直接和论文里的比吗?
不能。Sharp 与 Li 的原始定义用高表达基因参考集计算相对适应度 w,本页用的是全基因组平均。这是常见简化,但数值会有系统差异。它适合做同一宿主下不同序列版本之间的横向比较,不适合跨文献比数值。
稀有密码子阈值填多少合适?
默认 0.10 是常用起点。真正要紧的不是单个稀有密码子,而是它们**连成一串**——分散出现通常无碍,连续出现才容易造成核糖体停顿。扫描结果会单独指出相邻的情况。
把稀有密码子全换掉就能提高表达量吗?
不一定。密码子优化只解决翻译速率这一层,而表达失败还可能来自 mRNA 5′ 端二级结构、稀有 tRNA 池耗竭、蛋白折叠或毒性。另外过度优化(全部换成最优密码子)有时反而降低可溶性,因为翻译过快会打乱共翻译折叠的节奏。
CHO 细胞的数据可靠吗?
CHO(中国仓鼠)在 Kazusa 里只有 331 个 CDS,本页标了「样本偏小」。它是蛋白表达的常用宿主所以收录了,但数值的置信度明显低于人和小鼠,用时要知道这一点。