简短的回答
p 值是指如果原假设(无实际效果)确实为真,则看到的结果至少与您的结果一样极端的概率。较小的 p 值(通常低于 0.05)表明您的数据在该假设下会异常 - 反对原假设的证据,而不是证明它是错误的,也不是原假设本身为真的概率。
要点
- p < 0.05 并不能证明效果是真实的;这意味着如果确实没有影响,观察到的数据就不太可能。
- p 值取决于检验统计量、样本大小和变异性 - 如果样本足够大,微小的、不重要的效应仍然可以产生较小的 p 值。
- 双尾检验在两个方向上划分显着性,并且通常报告的 p 值大约是匹配单尾检验的两倍。
- 不同的检验统计量(z、t、卡方、F)来自不同的分布,因此相同的数值统计量可能会根据应用的检验产生非常不同的 p 值。
常见的显着性阈值
| p 值范围 | 典型解读 |
|---|---|
| p ≥ 0.10 | 几乎没有证据反对原假设 |
| 0.05 ≤ p < 0.10 | 证据薄弱或边际 |
| 0.01 ≤ p < 0.05 | Moderate evidence — commonly called "significant" |
| p < 0.01 | 反对原假设的有力证据 |
这些范围是惯例,而不是自然法则——不同领域(医学、物理学、社会科学)采用不同的阈值,具体取决于误报的成本有多大。
一尾与二尾
| 测试 | 提出的问题 | p 值关系 |
|---|---|---|
| 二尾 | 两个方向有什么区别吗? | ~2× 单尾 p 值 |
| 一尾 | 在某一特定方向上是否存在差异? | ~1/2 双尾 p 值 |
工作示例:z 检验 p 值
z = 1.96,双尾检验
p = 2 × (1 − Φ(1.96)) = 2 × (1 − 0.9750) = 0.05
这正是 1.96 在统计数据中如此频繁出现的原因 — 它是 z 分数,其双尾 p 值恰好落在传统的 0.05 阈值处,使其成为 95% 置信水平的标准截止值。
要避免的常见错误
- Treating the p-value as "the probability the null hypothesis is true" — it's computed assuming the null IS true, so it can't simultaneously measure the odds that it's true.
- 在查看数据的倾向后选择单尾测试的方向 - 必须在查看结果之前确定方向,否则测试将不再有效。
- 将 p = 0.05 视为强硬路线——p 值为 0.049 和 0.051 代表几乎相同的证据,尽管落在共同阈值的相反两侧。
- 将统计显着性与实际重要性混为一谈——足够大的样本甚至可以使一个微不足道的小、不重要的效应在统计上显着。