碱基日读 每天读完真实文献,只讲有用的那一段

工具统计分析

t 检验在线计算:独立样本 / 配对样本 / 单样本(含 Welch 校正)

粘贴两组数即可算出 t 值、自由度、双尾 p 值、均值差置信区间与 Cohen's d,默认用 Welch 校正。

独立样本、配对样本与单样本 t 检验,一次给出 t 值、自由度、双尾 p 值、 均值差的置信区间与效应量 Cohen’s d。粘贴两组数即可,不需要装任何东西。

三种检验分别用在哪

独立样本:两组是不同的个体,比如处理组与对照组的小鼠。默认用 Welch 校正, 它不假设两组方差相等——这是更稳妥的默认值,两组方差真的接近时结果与 Student 版几乎一样, 差得多时才救得回来。想要传统的 Student 版可以在下面切换。

配对样本:同一个体的前后两次测量,或同一批样本分到两种处理。 配对检验作用在差值上,把个体间差异消掉了,所以通常比独立样本检验更灵敏。 两组数据必须一一对应、顺序一致。

单样本:一组数与某个已知值比较,比如问回收率是否偏离 100%。

p 值之外要看的两个数

效应量(Cohen’s d)说明差异有多大,p 值只说明差异有多不像随机。 样本量足够大时,微不足道的差异也能给出很小的 p 值。两个数要一起看。

置信区间比 p 值信息量更大。 它同时告诉你差异的方向、大小和精度。 区间跨过 0 等价于 p > 0.05,但区间还会告诉你「跨得多」还是「刚好压线」—— 这是单看 p 值得不到的。

用之前必须知道的

t 检验假设数据近似正态、观测相互独立。 样本量很小(每组少于 5~6 个)时 无法有效检验正态性,此时结论对假设很敏感。明显偏态或有极端值时考虑非参数方法 (Mann-Whitney U / Wilcoxon 符号秩)。

技术重复不是生物学重复。 同一个样本测三次得到的三个数不是三个独立观测, 拿它们做 t 检验会把 n 虚增、p 值虚小。这是实验数据分析里最常见的错误之一。

做多组比较时不能两两做 t 检验就完事。 三组两两比较有 3 次检验, 假阳性率远高于 0.05,需要用方差分析或对 p 值做多重检验校正。

常见问题

为什么默认用 Welch 而不是 Student?

Welch 不假设两组方差相等。两组方差确实接近时,它和 Student 的结果几乎一样;方差差得多时,Student 会给出偏小的 p 值(假阳性偏高)而 Welch 不会。先做方差齐性检验再决定用哪个反而会抬高整体假阳性率,所以直接默认 Welch 更稳妥。

t 检验和方差分析该用哪个?

两组用 t 检验,三组及以上用方差分析。三组做两两 t 检验共 3 次,每次 α=0.05,至少一次假阳性的概率约 14%,远高于 0.05。如果确实要做两两比较,先做方差分析,再对两两比较的 p 值做多重检验校正。

样本量很小还能做 t 检验吗?

可以做,但要谨慎。每组少于 5~6 个时无法有效检验正态性,结论对分布假设很敏感。数据明显偏态或含极端值时,改用 Mann-Whitney U(独立)或 Wilcoxon 符号秩(配对)更稳妥。

为什么要看置信区间?

它比 p 值信息量大:同时给出差异的方向、大小和精度。区间跨过 0 等价于 p>0.05,但区间还告诉你是「远远跨过」还是「刚好压线」,这是单看 p 值得不到的。写论文时报告效应量与置信区间已经是主流要求。

为什么 p 值算得和 SPSS/R 完全一样?

因为用的是同一个数学定义:双尾 p = I_{df/(df+t²)}(df/2, 1/2),其中 I 是正则化不完全 Beta 函数,本页用它的连分式展开求值。本页的测试断言直接以 scipy.stats 的输出为基准逐位比对。

相关工具

单因素方差分析在线计算(含两两比较与多重校正)

三组及以上均值比较,给出 F 值、方差分析表、p 值与 η²,并可做两两比较(Bonferroni 或 BH 校正)。

Mann-Whitney U 与 Wilcoxon 符号秩检验在线计算

偏态数据或等级资料的两组比较,给出 U/W 统计量、精确或近似 p 值、效应量,并提示该样本量下最小可能的 p。

卡方检验与 Fisher 精确检验在线计算(含 OR / RR)

列联表独立性检验,给出 Pearson 卡方、Yates 校正与 Fisher 精确 p 值,2×2 表另给优势比与相对危险度及置信区间。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →