碱基日读 每天读完真实文献,只讲有用的那一段

工具统计分析

Mann-Whitney U 与 Wilcoxon 符号秩检验在线计算

偏态数据或等级资料的两组比较,给出 U/W 统计量、精确或近似 p 值、效应量,并提示该样本量下最小可能的 p。

Mann-Whitney U 检验(独立两组)与 Wilcoxon 符号秩检验(配对)。 数据明显偏态、含极端值或本身就是等级资料时,用这两个代替 t 检验。

它们和 t 检验的区别

t 检验比较的是均值,并假设数据近似正态。这两个检验比较的是—— 把所有数值排序后只看名次,不看具体数值。这带来两个后果:

好处:不依赖正态假设,极端值的影响被压缩(一个离群点只是排在最后一名, 不会像在均值里那样把结果整个拉偏)。

代价:丢掉了数值大小的信息,所以当数据确实接近正态时, 它们比 t 检验略不敏感(需要稍大的样本才能检出同样的差异)。

小样本时先看「最小可能的 p」

这是本页最想提醒的一件事。 秩检验的 p 值来自排列组合,样本太小时, 即使效应大到极限,p 也到不了 0.05

本页会先算出你这个样本量下的最小可能 p 并显示出来。如果它已经大于 α, 说明这个实验在开始之前就不可能得到显著结果——这时该做的是补样本, 而不是换检验方法。

精确法与正态近似

样本小且没有并列值时,本页用精确法:枚举所有可能的秩分配,直接数出比观测更极端的比例。 样本较大或存在并列值时改用正态近似(含连续性校正与并列校正)。

两者在小样本时差别可以很大:本页的示例数据用精确法得 p=0.00216,正态近似得 p=0.00507, 差了一倍多。存在并列值时精确法不再严格成立,这也是自动切换的原因, 输出里会写明用的是哪一种。

效应量

秩双列相关 r = 1 − 2U/(n₁n₂),取值 −1 到 1。 它表示「从第一组随机取一个数,比从第二组随机取的数大」的倾向有多强。 r = 0 表示两组完全交错,|r| = 1 表示两组完全分离。 和 t 检验一样:p 值说明差异有多不像随机,效应量才说明差异有多大。

常见问题

什么时候该用秩检验而不是 t 检验?

数据明显偏态、含极端值,或本身就是等级资料(如打分 1-5 分)时。样本量很小(每组少于 5~6 个)无法有效检验正态性,此时也可以用秩检验作为更稳妥的选择——但要先看本页给出的「最小可能 p」,样本太小时秩检验根本无法达到显著。

为什么 n=5 的配对检验永远不可能显著?

Wilcoxon 的 p 值来自符号的排列组合:n 对样本共有 2ⁿ 种符号分配,最极端的情形(全部同号)双尾 p = 2/2ⁿ。n=5 时是 2/32 = 0.0625,已经大于 0.05。这不是检验不够灵敏,是信息量的上限。遇到这种情况该补样本。

精确法和正态近似为什么差这么多?

小样本时秩统计量的分布离正态还很远,用正态去近似会有明显偏差。本页示例数据精确法得 p=0.00216,正态近似得 p=0.00507,差了一倍多。样本小且无并列值时本页自动用精确法;有并列值时精确法不再严格成立,才退回近似。

Mann-Whitney 检验的到底是不是中位数?

严格说不是。它检验的是「从一组随机取一个数大于从另一组随机取一个数」的概率是否等于 0.5。只有在两组分布形状相同、仅位置平移时,这才等价于比较中位数。分布形状不同(比如方差差别很大)时,显著结果说明两组分布不同,但不能直接解读成中位数不同。

秩双列相关 r 怎么解读?

r = 1 − 2U/(n₁n₂),范围 −1 到 1。它是「第一组的值倾向于大于第二组」的强度:r=0 表示两组完全交错,|r|=1 表示两组完全分离(一组的每个值都大于另一组的每个值)。和 p 值一起看:p 说明差异有多不像随机,r 说明差异有多大。

相关工具

卡方检验与 Fisher 精确检验在线计算(含 OR / RR)

列联表独立性检验,给出 Pearson 卡方、Yates 校正与 Fisher 精确 p 值,2×2 表另给优势比与相对危险度及置信区间。

相关系数在线计算:Pearson、Spearman 与 Kendall

一次算出三种相关系数与各自的 p 值,给出 Pearson 的置信区间与 r²,并在结果异常时提示离群点或非线性。

统计检验怎么选:按数据类型、组数与配对关系对照

回答三个问题就能定下用哪种检验:比数值还是比比例、有几组、是否配对。每一行直接链到对应工具。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →