常用限制酶识别序列速查表与酶切位点查找
30 种常用限制性内切酶的识别序列、切点与末端类型,以及一个位点查找框: 粘贴序列就能看出这些酶在哪里切、切出几个片段。
30 种常用限制酶
| 酶 | 识别序列(^ 为切点) | 长度 | 末端类型 | 突出 nt | 随机序列中平均间隔 |
|---|---|---|---|---|---|
| AgeI | A^CCGGT |
6 | 5′ 突出 | 4 | 4,096 bp |
| AluI | AG^CT |
4 | 平末端 | 0 | 256 bp |
| ApaI | GGGCC^C |
6 | 3′ 突出 | 4 | 4,096 bp |
| AvrII | C^CTAGG |
6 | 5′ 突出 | 4 | 4,096 bp |
| BamHI | G^GATCC |
6 | 5′ 突出 | 4 | 4,096 bp |
| BglII | A^GATCT |
6 | 5′ 突出 | 4 | 4,096 bp |
| BsrGI | T^GTACA |
6 | 5′ 突出 | 4 | 4,096 bp |
| ClaI | AT^CGAT |
6 | 5′ 突出 | 2 | 4,096 bp |
| DpnI | GA^TC |
4 | 平末端 | 0 | 256 bp |
| EcoRI | G^AATTC |
6 | 5′ 突出 | 4 | 4,096 bp |
| EcoRV | GAT^ATC |
6 | 平末端 | 0 | 4,096 bp |
| HaeIII | GG^CC |
4 | 平末端 | 0 | 256 bp |
| HindIII | A^AGCTT |
6 | 5′ 突出 | 4 | 4,096 bp |
| HpaII | C^CGG |
4 | 5′ 突出 | 2 | 256 bp |
| KpnI | GGTAC^C |
6 | 3′ 突出 | 4 | 4,096 bp |
| MluI | A^CGCGT |
6 | 5′ 突出 | 4 | 4,096 bp |
| MspI | C^CGG |
4 | 5′ 突出 | 2 | 256 bp |
| NcoI | C^CATGG |
6 | 5′ 突出 | 4 | 4,096 bp |
| NdeI | CA^TATG |
6 | 5′ 突出 | 2 | 4,096 bp |
| NotI | GC^GGCCGC |
8 | 5′ 突出 | 4 | 65,536 bp |
| PstI | CTGCA^G |
6 | 3′ 突出 | 4 | 4,096 bp |
| SacI | GAGCT^C |
6 | 3′ 突出 | 4 | 4,096 bp |
| SalI | G^TCGAC |
6 | 5′ 突出 | 4 | 4,096 bp |
| SmaI | CCC^GGG |
6 | 平末端 | 0 | 4,096 bp |
| SpeI | A^CTAGT |
6 | 5′ 突出 | 4 | 4,096 bp |
| SphI | GCATG^C |
6 | 3′ 突出 | 4 | 4,096 bp |
| TaqI | T^CGA |
4 | 5′ 突出 | 2 | 256 bp |
| XbaI | T^CTAGA |
6 | 5′ 突出 | 4 | 4,096 bp |
| XhoI | C^TCGAG |
6 | 5′ 突出 | 4 | 4,096 bp |
| XmaI | C^CCGGG |
6 | 5′ 突出 | 4 | 4,096 bp |
识别序列相同的酶
| 识别序列 | 酶 | 切点是否相同 | 关系 |
|---|---|---|---|
| CCGG | HpaII、MspI | 相同 | 同裂酶(isoschizomer) |
| CCCGGG | SmaI、XmaI | 不同 | 异裂酶(neoschizomer) |
这张表怎么来的
识别序列与切点取自 REBASE(The Restriction Enzyme Database,Roberts RJ 等, http://rebase.neb.com,version 609,2026-08-27)的原始数据文件,用程序解析,没有人工誊抄。
末端类型、突出长度、平均间隔这三列不是抄来的,是从切点算的: 识别序列长度 L、上链切点位于第 k 位时,突出长度 = L − 2k, 正数是 5′ 突出、负数是 3′ 突出、零是平末端。平均间隔取 4^L, 即随机序列中该长度回文位点的期望间隔。
数据做过两道校验:这 30 种酶的识别序列都必须是自身的反向互补(回文), 30/30 通过;末端类型另抽查 8 种与公认结果比对,全部吻合。
几个实际会踩的点
同一段识别序列,切点未必相同。 SmaI 和 XmaI 都认 CCCGGG,但 SmaI 切在 CCC^GGG
给出平末端,XmaI 切在 C^CCGGG 给出 4 nt 的 5′ 突出——产物不能互相连接。
这类叫异裂酶。HpaII 和 MspI 则是识别序列和切点都相同的同裂酶。
平均间隔只是数量级参考。 4^L 假设四种碱基等概率且独立,真实基因组两条都不满足: GC 含量偏离 50%、CpG 在脊椎动物基因组中显著稀少,都会让含 CG 的位点比公式预期稀疏得多。 把它当作「六碱基酶大约每几千 bp 切一次」的量级感,不要当作预测。
甲基化会让酶切不动。 同裂酶之间对甲基化的敏感性常常不同,这正是 HpaII/MspI 被成对使用来检测 CpG 甲基化的原因。具体某个酶是否被 Dam/Dcm/CpG 甲基化阻断, 以你所用供应商的说明为准——这张表不含甲基化信息。
常见问题
为什么 SmaI 和 XmaI 认同一段序列却不能互换?
它们的识别序列都是 CCCGGG,但切点不同:SmaI 切成 CCC^GGG 是平末端,XmaI 切成 C^CCGGG 留 4 nt 的 5′ 突出。产物末端形式不同,不能互相连接。这类关系叫异裂酶(neoschizomer)。识别序列和切点都相同的才是同裂酶,比如 HpaII 和 MspI。
表里的「平均间隔」能用来预测酶切几次吗?
只能当量级参考。4^L 假设四种碱基等概率且独立,真实基因组两条都不满足——GC 含量偏离 50%、CpG 在脊椎动物基因组里显著稀少,含 CG 的位点会比公式预期稀疏得多。要知道具体切几次,用上面的位点查找框跑你的实际序列。
为什么位点查找不支持简并碱基?
本表收录的 30 种酶识别序列都是确定碱基(ACGT),没有简并位。如果你的序列里有 N 或其他简并碱基,需要先展开成确定序列再查,否则无法判断该位置到底匹不匹配。
环状序列和线性序列的结果为什么不一样?
环状序列(质粒)上跨越起点的位点在线性模式下会被漏掉,而且片段数不同:线性序列 n 个位点切成 n+1 段,环状序列 n 个位点切成 n 段。选对拓扑很重要。
数据可靠吗?
识别序列与切点取自 REBASE 原始数据文件(version 609)用程序解析,没有人工誊抄环节。另做过两道校验:30 种酶的识别序列都必须是自身的反向互补,30/30 通过;末端类型抽查 8 种与公认结果比对,全部吻合。