짧은 대답
필요한 표본 크기는 원하는 자신감에 따라 커지고 더 큰 오차 한계를 허용하면 줄어듭니다. 비율의 경우 n = (z² × p × (1−p)) ¼ e²(여기서 z는 신뢰도 수준), p는 예상 비율(알 수 없는 경우 0.5), e는 허용 가능한 오류 한계입니다. 더 좁은 마진과 더 높은 신뢰도로 인해 필요한 표본 크기가 극적으로 늘어나는 경우가 많습니다.
주요 시사점
- e가 분모에서 제곱되기 때문에 오차 한계를 절반으로 줄이면 필요한 샘플 크기가 대략 4배가 됩니다.
- 실제 비율을 알 수 없는 경우 p = 0.5를 사용하는 것이 가장 안전한 선택입니다. 왜냐하면 p(1−p)가 거기에서 최대화되기 때문입니다. 다른 추측은 우연히 추측한 경우에만 더 작은 샘플이 필요합니다.
- 알려진 유한한 모집단 크기를 사용하면 작은 모집단에 필요한 표본을 의미 있게 줄이는 수정을 적용할 수 있지만 모집단이 표본보다 훨씬 커지면 거의 차이가 없습니다.
- 평균을 추정하려면 비율이 아닌 모집단의 표준 편차에 대한 추정이 필요합니다. 두 가지 계산 유형은 서로 관련되어 있지만 서로 다른 공식을 사용합니다.
비율 표본 크기 공식
n = (z² × p × (1 − p)) / e²
z는 신뢰 수준(95%에 대해 1.96)에서 나온 것이고, p는 예상 모집단 비율, e는 소수로 표현된 오차 한계(5% = 0.05)입니다.
오차 한계가 공식을 지배하는 이유
| 오류의 한계 | 필수 n(95% 신뢰도, p=0.5) |
|---|---|
| 10% | 97 |
| 5% | 385 |
| 2.5% | 1,537 |
| 1% | 9,604 |
오차 한계를 절반으로 줄이면 필요한 표본 크기가 대략 4배가 됩니다. 이는 전국 여론 조사에서 수만 명의 응답자가 필요한 ±1% 정밀도를 추구하는 대신 일반적으로 ±3~5% 한계에 만족하는 이유입니다.
실제 사례: 설문조사 계획하기
비율에 대한 사전 추정 없이 95% 신뢰도와 5% 오차 한계를 원합니다.
n = (1.96² × 0.5 × 0.5) / 0.05² = 0.9604 / 0.0025 ≒ 384.16
반올림: n = 385
표본 크기는 항상 반올림되며, 반올림되지 않습니다. 소수의 응답자는 불가능하며 반올림하면 목표 정밀도에 조금 못 미치게 됩니다.
피해야 할 일반적인 실수
- 표본 크기를 두 배로 늘리기 위해 절반의 오차 한계를 예상합니다. 대신 e가 제곱되기 때문에 대략 4배가 됩니다.
- Guessing a proportion far from 50% "to be safe" — that actually shrinks the calculated sample size, the opposite of conservative; 50% is the truly conservative (maximum) choice.
- 사실상 무한한 인구(전국 조사, 웹 트래픽)에 유한 인구 보정을 적용하면 해당 규모에서 보정이 거의 아무것도 변경하지 않습니다.
- 비율 공식과 평균 공식을 혼동하는 경우 - 평균 버전에는 비율이 아닌 표준 편차 추정치가 필요합니다.