引物二聚体与发夹结构在线检测(含 3′ 端互补分析)
检测引物的自身二聚体、发夹结构与引物对之间的交叉二聚体。
seq-stats 工具算 GC 与 Tm 时明说「自身互补与引物二聚体本工具不检测」——这一页把它补上。
为什么 3′ 端的互补最要命
引物二聚体不是「有互补就不行」,关键看互补落在哪一端。
DNA 聚合酶从 3′ 端延伸。如果两条引物的 3′ 端互相配对,聚合酶就会以对方为模板 把它们延长,生成一段短产物——它比目标片段短得多,扩增效率却高得多, 会迅速消耗掉引物和 dNTP。跑胶时底部那条又粗又亮的带,多半就是它。
反过来,如果互补发生在 5′ 端或中间,即使配对碱基更多,也不会被延伸, 危害小得多。所以本工具把 3′ 端连续互补数单独列出,它比总互补数更能说明问题。
判断标准
这些是业界常用的经验阈值,不是硬性界限:
| 指标 | 建议 | 理由 |
|---|---|---|
| 3′ 端连续互补 | ≤ 3 | 超过就容易被延伸成二聚体 |
| 任意位置最长连续互补 | ≤ 4–5 | 长互补段会稳定结合,降低有效引物浓度 |
| 发夹茎长 | ≤ 3–4 | 茎太长时引物自我折叠,无法与模板结合 |
一个反面例子
GCATCGATCGATCGATCGAT 看着很正常,实际是极差的引物:
它由 ATCGAT 重复构成,而 ATCGAT 是回文(ClaI 位点),
所以整条序列高度自互补——自身二聚体互补碱基 18 个、3′ 端连续互补 18 个。
光看 GC 含量和 Tm 完全看不出这个问题。 那条序列 GC 正好 50%、长度 20 nt, 按常规筛选标准是「合格」的。这就是为什么二聚体必须单独检查。
这个工具的边界
本工具用的是碱基互补计数,不是热力学 ΔG。 专业引物设计软件 (Primer3、IDT OligoAnalyzer 等)计算的是最近邻自由能,会把温度、盐浓度、 引物浓度都算进去,比单纯数碱基准确得多。 (引物本身与模板配对的 Tm 和 ΔG,本站的 最近邻法 Tm 计算器 可以算; 但二聚体、发夹这类自身折叠的 ΔG 需要另一套二级结构算法,两者不是一回事。)
本工具的定位是快速筛掉明显有问题的候选——3′ 端一串互补这种一眼可判的情况。 候选缩小到几条之后,再用专业软件算 ΔG 定夺。
另外本工具不做模板特异性检查。引物在基因组上有没有其他结合位点, 需要用 BLAST 或 Primer-BLAST 比对,这是浏览器里做不了的。
常见问题
为什么只强调 3′ 端的互补?
因为 DNA 聚合酶从 3′ 端延伸。两条引物的 3′ 端配上了,聚合酶就以对方为模板把它们延长,生成一段短产物——它比目标片段短得多、扩增效率却高得多,会迅速吃掉引物和 dNTP。互补如果发生在 5′ 端或中间,不会被延伸,危害小得多。
跑胶时底部那条又粗又亮的带是什么?
多半就是引物二聚体。它的长度通常在 40–100 bp 之间,位置远低于目标条带。出现这条带说明引物之间在互相扩增,目标产物的产率会被明显拖累。先用本工具查 3′ 端互补,再考虑提高退火温度或重新设计引物。
GC 含量和 Tm 都合格,为什么还是不好用?
因为那两项查不出二聚体。本页正文里的反面例子就是这种情况:GCATCGATCGATCGATCGAT 的 GC 正好 50%、长度 20 nt,按常规标准「合格」,但它由回文序列 ATCGAT 重复构成,高度自互补,是极差的引物。
和 Primer3、IDT OligoAnalyzer 有什么区别?
那些软件算的是最近邻热力学自由能 ΔG,把温度、盐浓度、引物浓度都算进去,准确得多。本工具数的是互补碱基数,是个快速筛子——用来在几十条候选里排掉明显有问题的,剩下几条再用专业软件定夺。两者不是替代关系。
为什么不检查引物在基因组上的特异性?
那需要把引物比对到整个基因组,数据量在 GB 量级,浏览器里做不了,而本站承诺数据不离开你的电脑。请用 NCBI 的 Primer-BLAST 或本地 BLAST 做这一步。