짧은 대답
Mean은 산술평균(sum ¼ count), median은 정렬했을 때 중간값, mode는 가장 빈번한 값, range는 가장 큰 값에서 가장 작은 값을 뺀 값입니다. 그들은 데이터 세트를 네 가지 각도, 즉 중심 위치(평균, 중앙값, 최빈값)와 분산 정도(범위)로 요약합니다.
주요 시사점
- 평균과 중앙값은 일반적으로 대칭 데이터에 대해 서로 가깝게 위치하지만, 이상값이나 편향이 그림에 들어오면 급격하게 분기됩니다.
- 데이터 세트에는 0개의 모드(모두 고유한 값), 하나의 모드 또는 여러 개의 모드(이중 모드/다중 모드)가 있을 수 있습니다. 모드는 정의되지 않을 수 있는 네 가지 모드 중 유일한 모드입니다.
- 범위는 두 개의 극값만 확인하므로 단일 이상값으로 인해 대량의 데이터에 대한 실제보다 산포가 훨씬 더 크게 보일 수 있습니다.
- 사분위간 범위(Q3 − Q1)는 각 끝에서 가장 극단적인 25%를 무시하므로 범위보다 더 강력한 확산 측정값입니다.
4가지 측정값 개요
| 측정하다 | 그것이 당신에게 말하는 것 | 특이치에 민감합니까? |
|---|---|---|
| 평균 | 데이터의 산술 중심 | 예 — 모든 값에 따라 이동 |
| 중앙값 | 정렬 시 중간 값 | 아니요 — 극한 상황에 대한 저항력 |
| 방법 | 가장 빈번한 값 | 아니요 — 극단값의 영향을 받지 않습니다. |
| 범위 | 가장 낮은 것부터 가장 높은 것까지 확산됨 | 예 — 전적으로 극단으로 정의됨 |
실제 사례: 하나의 데이터 세트, 네 개의 숫자
데이터: 12, 15, 12, 18, 20, 12, 25 — 정렬: 12, 12, 12, 15, 18, 20, 25
| 평균 | (12+15+12+18+20+12+25) ÷ 7 ≈ 16.29 |
| 중앙값 | 정렬된 목록의 네 번째 값 = 15 |
| 방법 | 12 (3회 등장) |
| 범위 | 25 − 12 = 13 |
평균(16.29)이 여기에서 중앙값(15)보다 위에 있고 25만큼 위쪽으로 당겨졌습니다. 이는 작은 데이터 세트에서도 약간 오른쪽으로 기울어지는 신호입니다.
IQR을 사용하여 이상값 발견
동일한 데이터 세트(12, 12, 12, 15, 18, 20, 25)를 계속 사용하면 중앙값을 기준으로 분할하면 아래쪽 절반은 12, 12, 12이고 위쪽 절반은 18, 20, 25가 됩니다. 한 가지 일반적인 방법은 각 절반의 중앙값을 사용합니다. Q1 = 12 및 Q3 = 20입니다.
IQR = Q3 − Q1 = 20 − 12 = 8
하한 = Q1 − 1.5×IQR = 12 − 12 = 0
상한 = Q3 + 1.5×IQR = 20 + 12 = 32
이 데이터 세트의 모든 값은 0과 32 사이에 속하므로 이 규칙에 따라 어떤 값도 이상치로 표시되지 않습니다. 25가 가장 큰 값이더라도 여전히 이 스프레드의 정상 범위 내에 있습니다.
피해야 할 일반적인 실수
- 평균과 중앙값은 항상 가깝다고 가정합니다. 즉, 데이터 세트가 왜곡되거나 이상치가 포함되면 크게 갈라집니다.
- 모든 데이터 세트에는 모드가 있을 것으로 예상합니다. 모든 값이 고유한 세트에는 모드가 전혀 없으며 모드가 0이 아닙니다.
- 범위만으로 확산 판단 - 단일 극단값으로 인해 대량의 데이터가 실제로 어떻게 작동하는지에 대해 범위가 오해될 수 있습니다.
- Q1/Q3이 서로 다른 도구 간에 정확히 일치한다고 가정하면 사분위수 계산에는 두 가지 이상의 허용 규칙이 있으므로 도구 간 작은 차이는 일반적입니다.