짧은 대답
신뢰 구간은 실제 모집단 값을 포함할 가능성이 있는 표본 통계를 중심으로 구축된 범위입니다. 구간 = 점 추정치 ± (임계 값 × 표준 오차). 95% 신뢰 구간은 샘플링 프로세스를 여러 번 반복하면 구성할 구간의 약 95%에 실제 모집단 모수가 포함된다는 의미입니다. 즉, 실제 값이 이 특정 구간 내에 포함될 확률이 95%라는 의미는 아닙니다.
주요 시사점
- A wider confidence level (99% vs. 90%) always produces a wider interval — you're trading precision for certainty, not getting a "more correct" answer.
- 모집단 표준 편차를 알고 있거나 표본이 큰 경우(n ≥ 30) z-분포를 사용합니다. 작은 표본에서 σ를 추정하는 경우 t-분포를 사용합니다.
- 표준 오차는 n 자체가 아니라 n의 제곱근으로 줄어들기 때문에 표본 크기를 4배로 늘리면 오차 한계가 절반으로 줄어듭니다.
- "95% confidence" describes the long-run reliability of the method across repeated sampling, not the probability that this specific interval contains the true value.
신뢰 구간 공식
평균(알려진 σ): CI = x̄ ± z × (σ / √n)
비율: CI = p̂ ± z × √(p̂(1 − p̂) / n)
| 신뢰 수준 | z 임계값 |
|---|---|
| 90% | 1.645 |
| 95% | 1.96 |
| 99% | 2.576 |
z 대 t: 사용할 임계값
| 상태 | 사용 | 왜 |
|---|---|---|
| σ가 알려져 있음, 모든 표본 크기 | z | 표준 정규 분포가 정확하게 적용됩니다. |
| σ 알 수 없음, n ≥ 30 | z (대략.) | 큰 표본은 t를 z와 거의 동일하게 만듭니다. |
| p 알 수 없음, n < 30 | t | 꼬리가 두꺼워지면 σ를 추정할 때 추가적인 불확실성이 발생합니다. |
실제 예: 표본 평균의 95% 간격
표본 평균 x̄ = 50.5, 표본 크기 n = 100, 표준 편차 σ = 10.5, 신뢰 수준 = 95%.
표준 오차 = σ / √n = 10.5 / √100 = 1.05
오차 한계 = 1.96 × 1.05 ≒ 2.06
95% CI = 50.5 ± 2.06 = [48.44, 52.56]
실제 모집단 평균이 48.44에서 52.56 사이에 있다고 95% 확신한다고 말할 수 있습니다. 즉, 이 방법은 동일한 방식으로 추출된 표본의 약 95%에서 실제 평균을 포착하지만 이 특정 구간이 95% 확률로 정확하다는 의미는 아닙니다.
피해야 할 일반적인 실수
- Interpreting "95% confidence" as "95% probability the true value is in this interval" — it's a statement about the long-run method, not this one computed interval.
- 표본이 작고 σ를 알 수 없는 경우 z를 사용하면 t-분포의 두꺼운 꼬리가 추가 불확실성을 설명하기 위해 특별히 존재합니다.
- 표본 크기를 두 배로 늘리면 오차 한계가 절반으로 줄어든다고 가정합니다. 표준 오차는 √n으로 줄어들기 때문에 실제로 한계를 절반으로 줄이려면 n을 4배로 늘려야 합니다.
- 비율 신뢰 구간을 잊어버리려면 0과 1 사이의 p̂가 필요하며 작은 표본에서는 0이나 1 근처에서 제대로 작동하지 않을 수 있습니다.