碱基日读 每天读完真实文献,只讲有用的那一段

工具序列处理

常用限制酶识别序列速查表与酶切位点查找

30 种常用限制酶的识别序列、切点、末端类型与平均间隔,并可粘贴序列查找酶切位点(支持线性与环状)。

5′3′3′5′NNNGAATTCNNNNNNCTTAAGNNNEcoRI · G^AATTC
EcoRI 在两条链上错开 4 个碱基切开,留下 5′ 突出末端。查询任一酶时下方会画出它自己的切法。

30 种常用限制性内切酶的识别序列、切点与末端类型,以及一个位点查找框: 粘贴序列就能看出这些酶在哪里切、切出几个片段。

30 种常用限制酶

识别序列(^ 为切点) 长度 末端类型 突出 nt 随机序列中平均间隔
AgeI A^CCGGT 6 5′ 突出 4 4,096 bp
AluI AG^CT 4 平末端 0 256 bp
ApaI GGGCC^C 6 3′ 突出 4 4,096 bp
AvrII C^CTAGG 6 5′ 突出 4 4,096 bp
BamHI G^GATCC 6 5′ 突出 4 4,096 bp
BglII A^GATCT 6 5′ 突出 4 4,096 bp
BsrGI T^GTACA 6 5′ 突出 4 4,096 bp
ClaI AT^CGAT 6 5′ 突出 2 4,096 bp
DpnI GA^TC 4 平末端 0 256 bp
EcoRI G^AATTC 6 5′ 突出 4 4,096 bp
EcoRV GAT^ATC 6 平末端 0 4,096 bp
HaeIII GG^CC 4 平末端 0 256 bp
HindIII A^AGCTT 6 5′ 突出 4 4,096 bp
HpaII C^CGG 4 5′ 突出 2 256 bp
KpnI GGTAC^C 6 3′ 突出 4 4,096 bp
MluI A^CGCGT 6 5′ 突出 4 4,096 bp
MspI C^CGG 4 5′ 突出 2 256 bp
NcoI C^CATGG 6 5′ 突出 4 4,096 bp
NdeI CA^TATG 6 5′ 突出 2 4,096 bp
NotI GC^GGCCGC 8 5′ 突出 4 65,536 bp
PstI CTGCA^G 6 3′ 突出 4 4,096 bp
SacI GAGCT^C 6 3′ 突出 4 4,096 bp
SalI G^TCGAC 6 5′ 突出 4 4,096 bp
SmaI CCC^GGG 6 平末端 0 4,096 bp
SpeI A^CTAGT 6 5′ 突出 4 4,096 bp
SphI GCATG^C 6 3′ 突出 4 4,096 bp
TaqI T^CGA 4 5′ 突出 2 256 bp
XbaI T^CTAGA 6 5′ 突出 4 4,096 bp
XhoI C^TCGAG 6 5′ 突出 4 4,096 bp
XmaI C^CCGGG 6 5′ 突出 4 4,096 bp

识别序列相同的酶

识别序列 切点是否相同 关系
CCGG HpaII、MspI 相同 同裂酶(isoschizomer)
CCCGGG SmaI、XmaI 不同 异裂酶(neoschizomer)

这张表怎么来的

识别序列与切点取自 REBASE(The Restriction Enzyme Database,Roberts RJ 等, http://rebase.neb.com,version 609,2026-08-27)的原始数据文件,用程序解析,没有人工誊抄。

末端类型、突出长度、平均间隔这三列不是抄来的,是从切点算的: 识别序列长度 L、上链切点位于第 k 位时,突出长度 = L − 2k, 正数是 5′ 突出、负数是 3′ 突出、零是平末端。平均间隔取 4^L, 即随机序列中该长度回文位点的期望间隔。

数据做过两道校验:这 30 种酶的识别序列都必须是自身的反向互补(回文), 30/30 通过;末端类型另抽查 8 种与公认结果比对,全部吻合。

几个实际会踩的点

同一段识别序列,切点未必相同。 SmaI 和 XmaI 都认 CCCGGG,但 SmaI 切在 CCC^GGG 给出平末端,XmaI 切在 C^CCGGG 给出 4 nt 的 5′ 突出——产物不能互相连接。 这类叫异裂酶。HpaII 和 MspI 则是识别序列和切点都相同的同裂酶。

平均间隔只是数量级参考。 4^L 假设四种碱基等概率且独立,真实基因组两条都不满足: GC 含量偏离 50%、CpG 在脊椎动物基因组中显著稀少,都会让含 CG 的位点比公式预期稀疏得多。 把它当作「六碱基酶大约每几千 bp 切一次」的量级感,不要当作预测。

甲基化会让酶切不动。 同裂酶之间对甲基化的敏感性常常不同,这正是 HpaII/MspI 被成对使用来检测 CpG 甲基化的原因。具体某个酶是否被 Dam/Dcm/CpG 甲基化阻断, 以你所用供应商的说明为准——这张表不含甲基化信息。

常见问题

为什么 SmaI 和 XmaI 认同一段序列却不能互换?

它们的识别序列都是 CCCGGG,但切点不同:SmaI 切成 CCC^GGG 是平末端,XmaI 切成 C^CCGGG 留 4 nt 的 5′ 突出。产物末端形式不同,不能互相连接。这类关系叫异裂酶(neoschizomer)。识别序列和切点都相同的才是同裂酶,比如 HpaII 和 MspI。

表里的「平均间隔」能用来预测酶切几次吗?

只能当量级参考。4^L 假设四种碱基等概率且独立,真实基因组两条都不满足——GC 含量偏离 50%、CpG 在脊椎动物基因组里显著稀少,含 CG 的位点会比公式预期稀疏得多。要知道具体切几次,用上面的位点查找框跑你的实际序列。

为什么位点查找不支持简并碱基?

本表收录的 30 种酶识别序列都是确定碱基(ACGT),没有简并位。如果你的序列里有 N 或其他简并碱基,需要先展开成确定序列再查,否则无法判断该位置到底匹不匹配。

环状序列和线性序列的结果为什么不一样?

环状序列(质粒)上跨越起点的位点在线性模式下会被漏掉,而且片段数不同:线性序列 n 个位点切成 n+1 段,环状序列 n 个位点切成 n 段。选对拓扑很重要。

数据可靠吗?

识别序列与切点取自 REBASE 原始数据文件(version 609)用程序解析,没有人工誊抄环节。另做过两道校验:30 种酶的识别序列都必须是自身的反向互补,30/30 通过;末端类型抽查 8 种与公认结果比对,全部吻合。

相关工具

非标准遗传密码表对照:线粒体、细菌与纤毛虫密码子差异速查

NCBI 全部 27 张遗传密码表,逐个密码子列出与标准表的差异,支持按表号与密码子查询。

密码子偏好性表与稀有密码子扫描(含 CAI 计算)

九个常用物种的密码子使用频率,粘贴 CDS 即可扫描稀有密码子、算 CAI,并给出每个氨基酸在该宿主里的最优密码子。

DNA / RNA 反向互补序列在线转换

粘贴序列即得反向互补、互补、反向三种结果,支持 FASTA 与 IUPAC 简并碱基。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →