The short answer
Bir p-değeri, boş hipotezin (gerçek etki yok) gerçekten doğru olması halinde, en azından sizinki kadar uç bir sonucu görme olasılığıdır. Küçük bir p değeri (genellikle 0,05'in altında), verilerinizin bu varsayım altında olağandışı olacağını gösterir; boş hipotezin doğru olduğuna dair kanıt değil, boş hipoteze karşı kanıt veya sıfır hipotezinin kendisinin doğru olma olasılığı değil.
Temel çıkarımlar
- p < 0,05 bir etkinin gerçek olduğunu kanıtlamaz; bu, gerçekten hiçbir etki olmasaydı gözlemlenen verilerin olası olmayacağı anlamına gelir.
- P değeri test istatistiğine, örneklem büyüklüğüne ve değişkenliğe bağlıdır; örneklem yeterince büyükse küçük, önemsiz bir etki yine de küçük bir p değeri üretebilir.
- İki kuyruklu testler, önemi her iki yöne böler ve genellikle eşleşen tek kuyruklu bir testin p değerinin kabaca iki katını rapor eder.
- Farklı test istatistikleri (z, t, ki-kare, F) farklı dağılımlardan gelir, dolayısıyla aynı sayısal istatistik, hangi testin uygulandığına bağlı olarak çok farklı p değerleri üretebilir.
Ortak önem eşikleri
| p değeri aralığı | Tipik yorum |
|---|---|
| p ≥ 0.10 | Boş hipoteze karşı çok az kanıt var veya hiç yok |
| 0.05 ≤ p < 0.10 | Zayıf veya marjinal kanıtlar |
| 0.01 ≤ p < 0.05 | Moderate evidence — commonly called "significant" |
| p < 0.01 | Boş hipoteze karşı güçlü kanıt |
Bu bantlar doğanın kanunları değil, geleneklerdir; farklı alanlar (tıp, fizik, sosyal bilimler) yanlış pozitifin ne kadar maliyetli olacağına bağlı olarak farklı eşik değerleri benimser.
Tek kuyruklu ve iki kuyruklu
| Test | Soru soruldu | p-değeri ilişkisi |
|---|---|---|
| İki kuyruklu | Her iki yönde de bir fark var mı? | ~2× tek kuyruklu p değeri |
| Tek kuyruklu | Belirli bir yönde bir fark var mı? | ~1/2 iki kuyruklu p değeri |
Çözümlü örnek: z testi p değeri
z = 1,96, iki kuyruklu test
p = 2 × (1 – Φ(1,96)) = 2 × (1 – 0,9750) = 0,05
1,96'nın istatistiklerde bu kadar sık görünmesinin nedeni tam olarak budur - iki kuyruklu p değeri tam olarak geleneksel 0,05 eşiğine inen z puanıdır, bu da onu %95 güven düzeyi için standart kesim yapar.
Common mistakes to avoid
- Treating the p-value as "the probability the null hypothesis is true" — it's computed assuming the null IS true, so it can't simultaneously measure the odds that it's true.
- Verilerin hangi yöne eğildiğini gördükten sonra tek kuyruklu bir testin yönünü seçmek; sonuçlara bakmadan önce yöne karar verilmelidir, aksi takdirde test artık geçerli olmaz.
- P = 0,05'i kesin bir çizgi olarak ele alırsak - 0,049 ve 0,051'lik bir p değeri, ortak eşiğin zıt taraflarında yer almasına rağmen neredeyse aynı kanıtları temsil eder.
- İstatistiksel önemi pratik önemle karıştırmak: Yeterince büyük bir örnek, önemsiz derecede küçük, önemsiz bir etkiyi bile istatistiksel olarak anlamlı hale getirebilir.
İlgili hesap makineleri
- Güven Aralığı Hesaplayıcı — Tek bir hipotezi test etmek yerine bir aralığı tahmin edin.
- Z-Score Hesaplayıcı — ham değeri bu hesaplayıcının test edebileceği z puanına dönüştürün.
- Standart Sapma Hesaplayıcı — Çoğu test istatistiğini besleyen değişkenliği hesaplayın.
- Örnek Boyutu Hesaplayıcı — Gerçek bir etkiyi tespit etmeye yetecek güce sahip bir çalışma planlayın.