简短的回答
Mean 是算术平均值(总和 ÷ 计数),中位数是排序后的中间值,众数是出现次数最多的值,范围是最大值减去最小值。他们一起从四个角度总结数据集——数据的中心位置(平均值、中位数、众数)以及数据的分布程度(范围)。
要点
- 对于对称数据,均值和中位数通常非常接近,但一旦出现异常值或偏差,它们就会急剧偏离。
- 数据集可以有零个模式(所有唯一值)、一种模式或多种模式(双峰/多峰)——模式是四种模式中唯一可以未定义的模式。
- 范围仅查看两个极值,因此单个异常值可能会使分布看起来比大部分数据的实际分布大得多。
- 四分位距 (Q3 − Q1) 是比极差更稳健的价差衡量标准,因为它忽略了两端最极端的 25%。
四项措施一览
| 措施 | 它告诉你什么 | 对异常值敏感? |
|---|---|---|
| 意思是 | 数据的算术中心 | 是的——随着每个值的变化而变化 |
| 中位数 | 排序后的中间值 | 否——能够抵抗极端情况 |
| 模式 | 最常见的值 | 否——不受极值影响 |
| 范围 | 分布从最低到最高 | 是的——完全由极端情况定义 |
工作示例:一个数据集,四个数字
数据:12, 15, 12, 18, 20, 12, 25 — 排序:12, 12, 12, 15, 18, 20, 25
| 意思是 | (12+15+12+18+20+12+25) ÷ 7 ≈ 16.29 |
| 中位数 | 排序列表中的第四个值 = 15 |
| 模式 | 12(出现3次) |
| 范围 | 25 − 12 = 13 |
请注意,均值 (16.29) 位于中位数 (15) 之上,向上拉动了 25 — 即使在小数据集中也是右偏的轻微迹象。
使用 IQR 发现异常值
继续相同的数据集 (12, 12, 12, 15, 18, 20, 25):围绕中位数进行分割,得到下半部分 12, 12, 12 和上半部分 18, 20, 25。一种常见的方法取每一半的中值:Q1 = 12,Q3 = 20。
IQR = Q3 − Q1 = 20 − 12 = 8
下界 = Q1 − 1.5×IQR = 12 − 12 = 0
上限 = Q3 + 1.5×IQR = 20 + 12 = 32
该数据集中的每个值都在 0 到 32 之间,因此该规则不会将任何值标记为异常值 - 尽管 25 是最大值,但它仍然在此价差的正常范围内。
要避免的常见错误
- 假设平均值和中位数总是很接近——一旦数据集出现偏差或包含异常值,它们就会显着偏离。
- 期望每个数据集都有一个众数——每个值都是唯一的数据集根本没有众数,而不是零众数。
- 仅从范围来判断散布——单个极值可能会使范围误导大部分数据的实际行为。
- 假设 Q1/Q3 在不同工具之间完全匹配 - 四分位数计算有多个公认的约定,因此较小的跨工具差异是正常的。