คำตอบสั้นๆ
ค่า p คือความน่าจะเป็นที่จะเห็นผลอย่างน้อยที่สุดเท่ากับของคุณ หากสมมติฐานว่าง (ไม่มีผลกระทบที่แท้จริง) เป็นจริง ค่า p เล็กน้อย (โดยทั่วไปต่ำกว่า 0.05) บ่งบอกว่าข้อมูลของคุณอาจผิดปกติภายใต้สมมติฐานดังกล่าว ซึ่งเป็นหลักฐานที่ขัดแย้งกับสมมติฐานว่าง ไม่ใช่ข้อพิสูจน์ว่าเป็นเท็จ และไม่ใช่ความน่าจะเป็นที่สมมติฐานว่างนั้นเป็นจริง
ประเด็นสำคัญ
- p < 0.05 ไม่ได้พิสูจน์ว่าเอฟเฟกต์มีจริง หมายความว่าข้อมูลที่สังเกตได้ไม่น่าจะเกิดขึ้นได้หากไม่มีผลกระทบจริงๆ
- ค่า p ขึ้นอยู่กับสถิติการทดสอบ ขนาดตัวอย่าง และความแปรปรวน ผลเล็กๆ น้อยๆ ที่ไม่สำคัญยังคงสามารถสร้างค่า p เล็กน้อยได้หากตัวอย่างมีขนาดใหญ่เพียงพอ
- การทดสอบแบบสองด้านแบ่งนัยสำคัญทั้งสองทิศทาง และโดยทั่วไปจะรายงานค่า p-value โดยประมาณเป็นสองเท่าของการทดสอบแบบด้านเดียวที่ตรงกัน
- สถิติการทดสอบที่แตกต่างกัน (z, t, ไคสแควร์, F) มาจากการแจกแจงที่แตกต่างกัน ดังนั้นสถิติตัวเลขเดียวกันจึงสามารถสร้างค่า p ที่แตกต่างกันมากได้ ขึ้นอยู่กับการทดสอบที่ใช้
เกณฑ์นัยสำคัญทั่วไป
| ช่วงค่า p | การตีความโดยทั่วไป |
|---|---|
| p ≥ 0.10 | มีหลักฐานเพียงเล็กน้อยหรือไม่มีเลยที่ขัดแย้งกับสมมติฐานที่เป็นโมฆะ |
| 0.05 ≤ p < 0.10 | หลักฐานอ่อนหรือร่อแร่ |
| 0.01 ≤ p < 0.05 | Moderate evidence — commonly called "significant" |
| p < 0.01 | หลักฐานที่ชัดเจนต่อต้านสมมติฐานว่าง |
วงดนตรีเหล่านี้เป็นแบบแผน ไม่ใช่กฎแห่งธรรมชาติ - สาขาต่างๆ (การแพทย์ ฟิสิกส์ สังคมศาสตร์) จะใช้เกณฑ์ที่แตกต่างกัน ขึ้นอยู่กับว่าผลบวกลวงจะมีค่าใช้จ่ายสูงเพียงใด
หางเดียวกับสองหาง
| ทดสอบ | คำถามที่ถาม | ความสัมพันธ์ค่า p |
|---|---|---|
| สองหาง | มีความแตกต่างในทิศทางใดทิศทางหนึ่งหรือไม่? | ~2× ค่า p ด้านเดียว |
| มีหางเดียว | มีความแตกต่างในทิศทางใดทิศทางหนึ่งหรือไม่? | ~1/2 ค่า p สองด้าน |
ตัวอย่างการทำงาน: z-test p-value
z = 1.96 การทดสอบแบบสองด้าน
p = 2 × (1 − Φ(1.96)) = 2 × (1 − 0.9750) = 0.05
นี่คือเหตุผลว่าทำไม 1.96 จึงปรากฏบ่อยครั้งในสถิติ นั่นคือคะแนน z ที่มีค่า p สองด้านตกลงอย่างแม่นยำที่เกณฑ์ 0.05 ทั่วไป ทำให้เป็นค่าตัดมาตรฐานสำหรับระดับความเชื่อมั่น 95%
ข้อผิดพลาดทั่วไปที่ควรหลีกเลี่ยง
- Treating the p-value as "the probability the null hypothesis is true" — it's computed assuming the null IS true, so it can't simultaneously measure the odds that it's true.
- การเลือกทิศทางของการทดสอบแบบด้านเดียวหลังจากดูว่าข้อมูลเอียงไปทางใด - จะต้องตัดสินใจทิศทางก่อนที่จะดูผลลัพธ์ ไม่เช่นนั้นการทดสอบจะใช้ไม่ได้อีกต่อไป
- การรักษา p = 0.05 เป็นเส้นแข็ง - ค่า p-value 0.049 และ 0.051 แสดงถึงหลักฐานที่เกือบจะเหมือนกันแม้ว่าจะลงจอดที่ด้านตรงข้ามของเกณฑ์ร่วมก็ตาม
- สร้างความสับสนระหว่างนัยสำคัญทางสถิติกับความสำคัญเชิงปฏิบัติ — ตัวอย่างที่มีขนาดใหญ่เพียงพอสามารถสร้างผลกระทบแม้เพียงเล็กน้อยและไม่สำคัญให้มีนัยสำคัญทางสถิติได้
เครื่องคิดเลขที่เกี่ยวข้อง
- เครื่องคำนวณช่วงความมั่นใจ — ประมาณช่วงแทนที่จะทดสอบสมมติฐานเดียว
- เครื่องคำนวณคะแนน Z — แปลงค่าดิบเป็นคะแนน z ที่เครื่องคิดเลขนี้สามารถทดสอบได้
- เครื่องคิดเลขค่าเบี่ยงเบนมาตรฐาน — คำนวณความแปรปรวนที่ป้อนเข้าสู่สถิติการทดสอบส่วนใหญ่
- เครื่องคิดเลขขนาดตัวอย่าง — วางแผนการศึกษาให้มีพลังเพียงพอที่จะตรวจพบผลกระทบที่แท้จริง