t 检验在线计算:独立样本 / 配对样本 / 单样本(含 Welch 校正)
独立样本、配对样本与单样本 t 检验,一次给出 t 值、自由度、双尾 p 值、 均值差的置信区间与效应量 Cohen’s d。粘贴两组数即可,不需要装任何东西。
三种检验分别用在哪
独立样本:两组是不同的个体,比如处理组与对照组的小鼠。默认用 Welch 校正, 它不假设两组方差相等——这是更稳妥的默认值,两组方差真的接近时结果与 Student 版几乎一样, 差得多时才救得回来。想要传统的 Student 版可以在下面切换。
配对样本:同一个体的前后两次测量,或同一批样本分到两种处理。 配对检验作用在差值上,把个体间差异消掉了,所以通常比独立样本检验更灵敏。 两组数据必须一一对应、顺序一致。
单样本:一组数与某个已知值比较,比如问回收率是否偏离 100%。
p 值之外要看的两个数
效应量(Cohen’s d)说明差异有多大,p 值只说明差异有多不像随机。 样本量足够大时,微不足道的差异也能给出很小的 p 值。两个数要一起看。
置信区间比 p 值信息量更大。 它同时告诉你差异的方向、大小和精度。 区间跨过 0 等价于 p > 0.05,但区间还会告诉你「跨得多」还是「刚好压线」—— 这是单看 p 值得不到的。
用之前必须知道的
t 检验假设数据近似正态、观测相互独立。 样本量很小(每组少于 5~6 个)时 无法有效检验正态性,此时结论对假设很敏感。明显偏态或有极端值时考虑非参数方法 (Mann-Whitney U / Wilcoxon 符号秩)。
技术重复不是生物学重复。 同一个样本测三次得到的三个数不是三个独立观测, 拿它们做 t 检验会把 n 虚增、p 值虚小。这是实验数据分析里最常见的错误之一。
做多组比较时不能两两做 t 检验就完事。 三组两两比较有 3 次检验, 假阳性率远高于 0.05,需要用方差分析或对 p 值做多重检验校正。
常见问题
为什么默认用 Welch 而不是 Student?
Welch 不假设两组方差相等。两组方差确实接近时,它和 Student 的结果几乎一样;方差差得多时,Student 会给出偏小的 p 值(假阳性偏高)而 Welch 不会。先做方差齐性检验再决定用哪个反而会抬高整体假阳性率,所以直接默认 Welch 更稳妥。
t 检验和方差分析该用哪个?
两组用 t 检验,三组及以上用方差分析。三组做两两 t 检验共 3 次,每次 α=0.05,至少一次假阳性的概率约 14%,远高于 0.05。如果确实要做两两比较,先做方差分析,再对两两比较的 p 值做多重检验校正。
样本量很小还能做 t 检验吗?
可以做,但要谨慎。每组少于 5~6 个时无法有效检验正态性,结论对分布假设很敏感。数据明显偏态或含极端值时,改用 Mann-Whitney U(独立)或 Wilcoxon 符号秩(配对)更稳妥。
为什么要看置信区间?
它比 p 值信息量大:同时给出差异的方向、大小和精度。区间跨过 0 等价于 p>0.05,但区间还告诉你是「远远跨过」还是「刚好压线」,这是单看 p 值得不到的。写论文时报告效应量与置信区间已经是主流要求。
为什么 p 值算得和 SPSS/R 完全一样?
因为用的是同一个数学定义:双尾 p = I_{df/(df+t²)}(df/2, 1/2),其中 I 是正则化不完全 Beta 函数,本页用它的连分式展开求值。本页的测试断言直接以 scipy.stats 的输出为基准逐位比对。