碱基日读 每天读完真实文献,只讲有用的那一段

工具统计分析

统计检验怎么选:按数据类型、组数与配对关系对照

回答三个问题就能定下用哪种检验:比数值还是比比例、有几组、是否配对。每一行直接链到对应工具。

选检验方法只需要回答三个问题:比较的是数值还是比例?有几组?数据是配对的吗? 下面的表按这三个维度排开,每一行都直接链到对应的工具。

比较「数值」——均值或分布位置

组数 设计 数据分布 用什么 工具
1 组 vs 已知值 近似正态 单样本 t 检验 t 检验
2 组 独立 近似正态 Welch t 检验(默认) t 检验
2 组 独立 偏态 / 有极端值 / 等级 Mann-Whitney U 非参数检验
2 组 配对 近似正态 配对 t 检验 t 检验
2 组 配对 偏态 / 等级 Wilcoxon 符号秩 非参数检验
3 组以上 独立 正态、方差齐 单因素方差分析 方差分析
3 组以上 独立 正态、方差不齐 Welch 方差分析 方差分析
3 组以上 独立 偏态 / 等级 Kruskal-Wallis 方差分析
3 组以上 重复测量 重复测量方差分析 / 混合效应模型 本站暂无

比较「比例」——分类数据与列联表

表格 设计 条件 用什么 工具
2×2 独立 各格期望 ≥ 5 Pearson 卡方 卡方与 Fisher
2×2 独立 有格期望 < 5 Fisher 精确检验 卡方与 Fisher
R×C 独立 各格期望 ≥ 5 Pearson 卡方 卡方与 Fisher
2×2 配对 McNemar 检验 卡方与 Fisher

看「关联」——两个变量之间

变量类型 关系形态 用什么 工具
两个连续 直线 Pearson r 相关系数
两个连续 单调但弯曲 Spearman ρ / Kendall τ 相关系数
一个连续 vs 一个连续 要预测数值 线性回归 标准曲线

检验之后

情况 用什么 工具
一次做了很多检验 BH / BY / Bonferroni 校正 多重检验校正
方差分析显著,要定位到哪两组 两两比较 + 多重校正 方差分析
实验前算需要多少样本 样本量估算 样本量
基因列表重叠是否显著 超几何 / Fisher 富集显著性

三个决定一切的问题

一、比的是数值还是比例? 体重、表达量、OD 值是数值,用 t 检验那一族; 「有效/无效」「阳性/阴性」的人数是比例,用卡方那一族。 把比例硬当数值算(比如对 0/1 做 t 检验)是最常见的错配。

二、有几组? 两组用 t 检验,三组以上用方差分析。 三组两两做 t 检验是错的——三次比较里至少一次假阳性的概率约 14%, 六次约 26%,远高于你以为的 5%。

三、配对还是独立? 同一个体的前后两次测量、配对匹配的病例对照,都是配对数据。 配对检验作用在差值上,把个体间差异消掉了,通常比独立检验更灵敏。 把配对数据当独立数据分析会白白损失功效,反过来则会高估显著性。

正态性怎么判断

严格说要看数据的分布,但有两条实用原则:

样本量小于 5~6 个时,正态性根本检验不出来。 此时正态性检验(如 Shapiro-Wilk) 几乎没有功效,做了也不能说明什么。这种情况下若对分布没有把握, 用秩检验更稳妥——但要先看它在这个样本量下最小可能的 p 值, n=5 的配对秩检验最小双尾 p 就是 0.0625,无论效应多大都到不了 0.05。

明显偏态、有极端值、或本身就是等级资料(如 1–5 分打分)时,直接用秩检验。 不必先做正态性检验再决定——那样会让整体假阳性率升高。

本站没有的

诚实起见列出来:重复测量方差分析混合效应模型(同一个体多次测量、 或有随机效应的设计)本站没有提供。这类模型需要指定协方差结构, 不适合做成填几个数就出结果的网页工具,请用 R 的 lme4/nlme 或 SPSS。

生存分析(Kaplan-Meier、Cox 回归)同样不在本站范围内。

常见问题

为什么不能先做正态性检验再决定用哪个方法?

因为那会让整体假阳性率升高:你用同一批数据先选方法再做检验,选择本身依赖数据。而且样本量小时正态性检验几乎没有功效——最需要判断的时候它最不管用。实践中的做法是按数据类型和领域惯例事先定好:明显偏态或等级资料直接用秩检验,其余用参数检验并报告效应量。

三组两两做 t 检验到底错在哪?

每次检验的 α=0.05 是单次的假阳性率。三组两两比较共 3 次,至少一次假阳性的概率约 14%;六组共 15 次,约 54%。方差分析用一次检验回答「这几组里是否存在差异」,把整体假阳性率控制在 α。确实要两两比较时,应在方差分析之后做,并对 p 值做多重检验校正。

配对数据当独立数据分析会怎样?

会损失功效。配对设计的价值在于消掉个体间差异——同一个人前后测两次,个体基线的高低不影响差值。当成独立两组,个体间差异会进入误差项,把真实效应淹没掉。反过来,把独立数据硬配对则会高估显著性。

本站为什么不做重复测量方差分析?

它需要指定协方差结构(球形假设是否成立、用哪种校正),不同选择会给出不同结果,做成「填几个数就出答案」的网页工具容易误导。混合效应模型同理。这类分析建议用 R 的 lme4/nlme 或 SPSS。

选好方法之后还要注意什么?

两件事。一是多重检验:一次做了很多检验就要校正 p 值。二是效应量与置信区间:p 值只回答「差异像不像随机」,样本量足够大时毫无实际意义的差异也会显著。报结果时两者都要给。

相关工具

多重检验校正在线计算:BH (FDR)、BY 与 Bonferroni

粘贴一列 p 值,一次得到 BH 的 q 值、BY 与 Bonferroni 校正值,三者并列对照。

qPCR 2^-ΔΔCt 相对定量在线计算

粘贴 Ct 表,自动算 ΔCt、ΔΔCt、相对表达倍数与组内离散度。

基因列表交集并集差集在线计算(Venn 集合运算)

粘贴 2–3 组基因/ID 列表,一键得到交集、并集、各自独有,含去重与大小写归一。

没有广告,不收集数据,每个公式都验算过。维护它需要持续投入——如果帮你省了时间,请杯咖啡。
请杯咖啡 了解更多 →