Câu trả lời ngắn gọn
Độ lệch chuẩn đo lường mức độ phân tán của dữ liệu xung quanh giá trị trung bình, theo cùng đơn vị với dữ liệu gốc. Tính toán nó bằng cách tìm độ lệch bình phương của mỗi giá trị so với giá trị trung bình, lấy trung bình các độ lệch bình phương đó (phương sai), sau đó lấy căn bậc hai. Một cụm giá trị chặt chẽ sẽ cho ra SD nhỏ; các giá trị phân tán rộng rãi cho SD lớn.
Bài học chính
- SD mẫu chia cho (n−1), chứ không phải n — hiệu chỉnh Bessel — để tránh đánh giá thấp một cách có hệ thống mức độ lây lan quần thể thực sự.
- Độ lệch chuẩn có cùng đơn vị với dữ liệu gốc; phương sai được tính theo đơn vị bình phương, đó là lý do tại sao SD, chứ không phải phương sai, thường được báo cáo.
- Quy tắc thực nghiệm (68-95-99.7) chỉ áp dụng cho dữ liệu gần giống hình chuông (bình thường) — nó không áp dụng cho các phân bố sai lệch hoặc đa phương thức.
- Bình phương độ lệch trước khi lấy trung bình (thay vì chỉ lấy trung bình độ lệch tuyệt đối) sẽ phạt nặng hơn những độ lệch lớn hơn, đó là lý do tại sao phương sai và SD trở thành thước đo mức chênh lệch tiêu chuẩn.
Công thức độ lệch chuẩn, từng bước
| Bước chân | Hoạt động |
|---|---|
| 1 | Tìm giá trị trung bình của tập dữ liệu |
| 2 | Trừ giá trị trung bình từ mỗi giá trị (độ lệch) |
| 3 | Bình phương mỗi độ lệch |
| 4 | Tính trung bình độ lệch bình phương (chia cho n hoặc n−1) - đây là phương sai |
| 5 | Lấy căn bậc hai của phương sai - đây là độ lệch chuẩn |
Mẫu so với dân số: hiệu chỉnh n-1
Đối với tập dữ liệu {2, 4, 6, 8}, giá trị trung bình = 5 và độ lệch bình phương là 9, 1, 1, 9 (tổng = 20):
Phương sai quần thể = 20 4 = 5 → SD quần thể = √5 ≈ 2,236
Phương sai mẫu = 20 3 ≈ 6,667 → SD mẫu = √6,667 ≈ 2,582
Phiên bản mẫu luôn bằng hoặc lớn hơn phiên bản dân số cho cùng một dữ liệu - chia cho một số nhỏ hơn (n−1 thay vì n) sẽ làm tăng ước tính một chút, điều chỉnh vì thực tế là một mẫu có xu hướng đánh giá thấp mức độ lây lan thực sự của toàn bộ dân số.
Quy tắc thực nghiệm cho dữ liệu bình thường
| Phạm vi | % dữ liệu (phân phối bình thường) |
|---|---|
| Trung bình ± 1 SD | 68% |
| Trung bình ± 2 SD | 95% |
| Trung bình ± 3 SD | 99.7% |
Quy tắc này là một biện pháp kiểm tra nhanh chóng tính đúng đắn đối với dữ liệu hình chuông, không phải là một quy luật phổ quát - nó bị phá vỡ đối với các phân phối sai lệch, đa phương thức hoặc có đuôi nặng.
Những lỗi thường gặp cần tránh
- Quên bước căn bậc hai cuối cùng - phương sai và độ lệch chuẩn thường bị nhầm lẫn, nhưng chúng không thể thay thế cho nhau vì chúng ở các đơn vị khác nhau.
- Sử dụng công thức dân số (/n) khi cố gắng ước tính mức độ lây lan của một dân số từ một mẫu - điều này đánh giá thấp mức độ biến thiên thực sự.
- Áp dụng quy tắc thực nghiệm cho dữ liệu không có dạng hình chuông - dữ liệu bị lệch sẽ không tuân theo mẫu 68-95-99,7.
- Tính toán độ lệch so với giá trị trung bình thay vì giá trị trung bình - độ lệch chuẩn được xác định cụ thể xung quanh giá trị trung bình.
Máy tính liên quan
- Máy tính trung bình — tính giá trị trung bình mà máy tính này đo được xung quanh.
- Máy tính trung bình, trung vị, chế độ và phạm vi — có được bức tranh thống kê đầy đủ hơn cùng với SD.
- Máy tính khoảng tin cậy — sử dụng SD để xây dựng ước tính phạm vi cho giá trị trung bình của tổng thể.
- Máy tính điểm Z — xem một giá trị nằm cách giá trị trung bình bao nhiêu độ lệch chuẩn.