简短的回答
置信区间是围绕可能包含真实总体值的样本统计量构建的范围:区间 = 点估计 ±(临界值 × 标准误差)。 95% 置信区间意味着,如果您多次重复采样过程,则您构建的大约 95% 的区间将包含真实总体参数,而不是说真实值有 95% 的机会位于这一特定区间内。
要点
- A wider confidence level (99% vs. 90%) always produces a wider interval — you're trading precision for certainty, not getting a "more correct" answer.
- 当总体标准差已知或样本较大 (n ≥ 30) 时,使用 z 分布;当根据小样本估计 σ 时,使用 t 分布。
- 将样本量增加四倍只会使误差幅度减半,因为标准误差随 n 的平方根缩小,而不是随 n 本身缩小。
- "95% confidence" describes the long-run reliability of the method across repeated sampling, not the probability that this specific interval contains the true value.
置信区间公式
平均值(σ 已知):CI = x̄ ± z × (σ / √n)
比例:CI = p̂ ± z × √(p̂(1 − p̂) / n)
| 置信度 | z 临界值 |
|---|---|
| 90% | 1.645 |
| 95% | 1.96 |
| 99% | 2.576 |
z 与 t:使用哪个临界值
| 健康)状况 | 使用 | 为什么 |
|---|---|---|
| σ 已知,任意样本量 | z | 标准正态分布完全适用 |
| σ 未知,n ≥ 30 | z (约。) | 大样本使 t 与 z 几乎相同 |
| p 未知,n < 30 | t | 较肥尾会导致估计 σ 时产生额外的不确定性 |
工作示例:样本均值的 95% 区间
样本均值 x̄ = 50.5,样本大小 n = 100,标准差 σ = 10.5,置信水平 = 95%。
标准误差 = σ / √n = 10.5 / √100 = 1.05
误差幅度 = 1.96 × 1.05 ≈ 2.06
95% CI = 50.5 ± 2.06 = [48.44, 52.56]
我们可以说,我们有 95% 的信心认为真实总体平均值落在 48.44 到 52.56 之间,这意味着该方法捕获了以相同方式抽取的约 95% 样本中的真实平均值,而不是说这个特定区间有 95% 的机会是正确的。
要避免的常见错误
- Interpreting "95% confidence" as "95% probability the true value is in this interval" — it's a statement about the long-run method, not this one computed interval.
- 当样本较小且 σ 未知时使用 z — t 分布的肥尾专门用于解释额外的不确定性。
- 假设样本量加倍,误差幅度减半——实际上需要将 n 增加四倍才能将误差幅度减半,因为标准误差随着 √n 的减小而缩小。
- 忘记比例置信区间需要 p̂ 在 0 和 1 之间,并且对于小样本,在 0 或 1 附近可能表现不佳。