统计检验怎么选:按数据类型、组数与配对关系对照
选检验方法只需要回答三个问题:比较的是数值还是比例?有几组?数据是配对的吗? 下面的表按这三个维度排开,每一行都直接链到对应的工具。
比较「数值」——均值或分布位置
| 组数 | 设计 | 数据分布 | 用什么 | 工具 |
|---|---|---|---|---|
| 1 组 vs 已知值 | — | 近似正态 | 单样本 t 检验 | t 检验 |
| 2 组 | 独立 | 近似正态 | Welch t 检验(默认) | t 检验 |
| 2 组 | 独立 | 偏态 / 有极端值 / 等级 | Mann-Whitney U | 非参数检验 |
| 2 组 | 配对 | 近似正态 | 配对 t 检验 | t 检验 |
| 2 组 | 配对 | 偏态 / 等级 | Wilcoxon 符号秩 | 非参数检验 |
| 3 组以上 | 独立 | 正态、方差齐 | 单因素方差分析 | 方差分析 |
| 3 组以上 | 独立 | 正态、方差不齐 | Welch 方差分析 | 方差分析 |
| 3 组以上 | 独立 | 偏态 / 等级 | Kruskal-Wallis | 方差分析 |
| 3 组以上 | 重复测量 | — | 重复测量方差分析 / 混合效应模型 | 本站暂无 |
比较「比例」——分类数据与列联表
| 表格 | 设计 | 条件 | 用什么 | 工具 |
|---|---|---|---|---|
| 2×2 | 独立 | 各格期望 ≥ 5 | Pearson 卡方 | 卡方与 Fisher |
| 2×2 | 独立 | 有格期望 < 5 | Fisher 精确检验 | 卡方与 Fisher |
| R×C | 独立 | 各格期望 ≥ 5 | Pearson 卡方 | 卡方与 Fisher |
| 2×2 | 配对 | — | McNemar 检验 | 卡方与 Fisher |
看「关联」——两个变量之间
| 变量类型 | 关系形态 | 用什么 | 工具 |
|---|---|---|---|
| 两个连续 | 直线 | Pearson r | 相关系数 |
| 两个连续 | 单调但弯曲 | Spearman ρ / Kendall τ | 相关系数 |
| 一个连续 vs 一个连续 | 要预测数值 | 线性回归 | 标准曲线 |
检验之后
| 情况 | 用什么 | 工具 |
|---|---|---|
| 一次做了很多检验 | BH / BY / Bonferroni 校正 | 多重检验校正 |
| 方差分析显著,要定位到哪两组 | 两两比较 + 多重校正 | 方差分析 |
| 实验前算需要多少样本 | 样本量估算 | 样本量 |
| 基因列表重叠是否显著 | 超几何 / Fisher | 富集显著性 |
三个决定一切的问题
一、比的是数值还是比例? 体重、表达量、OD 值是数值,用 t 检验那一族; 「有效/无效」「阳性/阴性」的人数是比例,用卡方那一族。 把比例硬当数值算(比如对 0/1 做 t 检验)是最常见的错配。
二、有几组? 两组用 t 检验,三组以上用方差分析。 三组两两做 t 检验是错的——三次比较里至少一次假阳性的概率约 14%, 六次约 26%,远高于你以为的 5%。
三、配对还是独立? 同一个体的前后两次测量、配对匹配的病例对照,都是配对数据。 配对检验作用在差值上,把个体间差异消掉了,通常比独立检验更灵敏。 把配对数据当独立数据分析会白白损失功效,反过来则会高估显著性。
正态性怎么判断
严格说要看数据的分布,但有两条实用原则:
样本量小于 5~6 个时,正态性根本检验不出来。 此时正态性检验(如 Shapiro-Wilk) 几乎没有功效,做了也不能说明什么。这种情况下若对分布没有把握, 用秩检验更稳妥——但要先看它在这个样本量下最小可能的 p 值, n=5 的配对秩检验最小双尾 p 就是 0.0625,无论效应多大都到不了 0.05。
明显偏态、有极端值、或本身就是等级资料(如 1–5 分打分)时,直接用秩检验。 不必先做正态性检验再决定——那样会让整体假阳性率升高。
本站没有的
诚实起见列出来:重复测量方差分析与混合效应模型(同一个体多次测量、
或有随机效应的设计)本站没有提供。这类模型需要指定协方差结构,
不适合做成填几个数就出结果的网页工具,请用 R 的 lme4/nlme 或 SPSS。
生存分析(Kaplan-Meier、Cox 回归)同样不在本站范围内。
常见问题
为什么不能先做正态性检验再决定用哪个方法?
因为那会让整体假阳性率升高:你用同一批数据先选方法再做检验,选择本身依赖数据。而且样本量小时正态性检验几乎没有功效——最需要判断的时候它最不管用。实践中的做法是按数据类型和领域惯例事先定好:明显偏态或等级资料直接用秩检验,其余用参数检验并报告效应量。
三组两两做 t 检验到底错在哪?
每次检验的 α=0.05 是单次的假阳性率。三组两两比较共 3 次,至少一次假阳性的概率约 14%;六组共 15 次,约 54%。方差分析用一次检验回答「这几组里是否存在差异」,把整体假阳性率控制在 α。确实要两两比较时,应在方差分析之后做,并对 p 值做多重检验校正。
配对数据当独立数据分析会怎样?
会损失功效。配对设计的价值在于消掉个体间差异——同一个人前后测两次,个体基线的高低不影响差值。当成独立两组,个体间差异会进入误差项,把真实效应淹没掉。反过来,把独立数据硬配对则会高估显著性。
本站为什么不做重复测量方差分析?
它需要指定协方差结构(球形假设是否成立、用哪种校正),不同选择会给出不同结果,做成「填几个数就出答案」的网页工具容易误导。混合效应模型同理。这类分析建议用 R 的 lme4/nlme 或 SPSS。
选好方法之后还要注意什么?
两件事。一是多重检验:一次做了很多检验就要校正 p 值。二是效应量与置信区间:p 值只回答「差异像不像随机」,样本量足够大时毫无实际意义的差异也会显著。报结果时两者都要给。