Jak obliczyć p-value? Poradnik krok po kroku
p-value nie oblicza się jako jednej uniwersalnej liczby. Najpierw trzeba wybrać test statystyczny, obliczyć jego statystykę i określić rozkład, z którego wynika wartość p. W Excelu najczęściej używa się funkcji T.TEST dla porównania średnich oraz CHISQ.DIST.RT dla statystyki chi-kwadrat.
Czym jest p-value?
Wartość p to prawdopodobieństwo uzyskania wyniku co najmniej tak skrajnego jak zaobserwowany, przy założeniu, że hipoteza zerowa H0 jest prawdziwa. Mała wartość p oznacza, że dane są słabo zgodne z H0, ale nie wyraża prawdopodobieństwa, że hipoteza zerowa jest prawdziwa lub fałszywa.
Obliczenie zawsze zależy od statystyki testowej i jej rozkładu. Innej funkcji używa się dla statystyki t, innej dla chi-kwadrat, a jeszcze innej dla rozkładu F. Znaczenie ma także kierunek hipotezy alternatywnej: test może być jednostronny albo dwustronny.
Jak wybrać test statystyczny?
Dobór testu zależy przede wszystkim od rodzaju danych, liczby grup i pytania badawczego. Najczęstsze przypadki przedstawia tabela:
| Typ danych | Cel | Test | Rozkład |
|---|---|---|---|
| Dane ilościowe w jednej lub dwóch grupach | Porównanie średnich | t-Studenta | t-Studenta |
| Dwie zmienne jakościowe | Sprawdzenie zależności w tabeli kontyngencji | chi-kwadrat niezależności | chi-kwadrat |
| Dane jakościowe i rozkład teoretyczny | Sprawdzenie zgodności częstości | chi-kwadrat zgodności | chi-kwadrat |
| Trzy lub więcej grup ilościowych | Porównanie średnich grup | ANOVA | F Fishera-Snedecora |
| Dwie wariancje | Porównanie zmienności | test F | F Fishera-Snedecora |
Przed obliczeniem sprawdź następujące elementy:
- Rodzaj danych – ilościowe, jakościowe albo uporządkowane.
- Liczbę grup – jedną, dwie lub co najmniej trzy.
- Zależność obserwacji – próbki mogą być niezależne albo sparowane.
- Założenia testu – między innymi niezależność obserwacji, rozkład danych i liczebności oczekiwane.
W teście chi-kwadrat zmienne muszą być kategoryczne, a obserwacje niezależne. Gdy oczekiwane liczebności w komórkach tabeli są bardzo małe, wynik chi-kwadrat może być niewiarygodny. Dla tabel 2 × 2 często rozważa się wtedy dokładny test Fishera.
Jak obliczyć p-value w Excelu?
Najpierw przygotuj dane i z góry określ hipotezę zerową, alternatywną oraz poziom istotności, na przykład α = 0,05. Następnie wybierz funkcję odpowiadającą testowi.
- Przygotuj dane – umieść obserwacje w kolumnach lub przygotuj tabelę kontyngencji.
- Wybierz test – porównanie średnich wymaga zwykle testu t, a zależność zmiennych jakościowych testu chi-kwadrat.
- Ustal liczbę ogonów – wartość 1 oznacza test jednostronny, a wartość 2 test dwustronny, gdy funkcja przyjmuje taki argument.
- Wpisz funkcję Excela – użyj T.TEST, CHISQ.TEST albo funkcji rozkładu dla wcześniej obliczonej statystyki.
- Porównaj wynik z α – decyzję podejmij na podstawie wcześniej ustalonego poziomu istotności.
Porównanie średnich – funkcja T.TEST
Jeśli masz dwie próby zapisane na przykład w zakresach A2:A21 i B2:B21, wartość p dla testu t możesz obliczyć funkcją:
=T.TEST(A2:A21;B2:B21;2;2)
Argumenty oznaczają kolejno zakres pierwszej próby, zakres drugiej próby, liczbę ogonów oraz typ testu. Wartość 2 jako trzeci argument oznacza test dwustronny. Ostatni argument określa wariant testu: 1 oznacza test sparowany, 2 test dwóch prób z równymi wariancjami, a 3 test dwóch prób z różnymi wariancjami.
W polskiej wersji Excela separatorem argumentów może być średnik, natomiast w ustawieniach używających angielskiego zapisu często stosuje się przecinki. Nazwa funkcji może również zależeć od wersji językowej programu. Należy sprawdzić składnię używaną w konkretnym Excelu.
Test chi-kwadrat – funkcja CHISQ.TEST
W przypadku tabeli kontyngencji przygotuj dwa zakresy o takim samym układzie: wartości zaobserwowane i wartości oczekiwane. Wartość p obliczysz na przykład tak:
=CHISQ.TEST(A2:B3;D2:E3)
Funkcja porównuje obserwowane i oczekiwane częstości, zwracając wartość p dla testu chi-kwadrat. W teście niezależności wartości oczekiwane wyznacza się zwykle według wzoru:
E = (suma wiersza × suma kolumny) / suma całkowita
Jeśli masz już obliczoną wartość statystyki χ² i znasz stopnie swobody, możesz użyć funkcji prawego ogona rozkładu:
=CHISQ.DIST.RT(wartość_chi_kwadrat;stopnie_swobody)
Test niezależności i test zgodności chi-kwadrat są zazwyczaj testami prawostronnymi. Dla tabeli z r wierszami i c kolumnami stopnie swobody wynoszą (r − 1) × (c − 1). W teście zgodności są zwykle równe liczbie kategorii pomniejszonej o jeden.
ANOVA i test F
ANOVA służy do porównania średnich w co najmniej trzech grupach. Statystyka testowa ma rozkład F Fishera-Snedecora, a wynik p najwygodniej uzyskać z narzędzia „Analiza danych” i procedury „ANOVA: jednoczynnikowa”. W prostym przeliczeniu wcześniej obliczonej statystyki F można użyć funkcji:
=F.DIST.RT(statystyka_F;stopnie_swobody_1;stopnie_swobody_2)
Wynik funkcji jest wartością p dla prawego ogona. Liczba stopni swobody zależy od zastosowanego testu, dlatego nie należy wpisywać jej bez sprawdzenia modelu.
Jak interpretować wynik p-value?
Wynik porównuje się z poziomem istotności ustalonym przed analizą. Najczęściej stosuje się α = 0,05, ale ta wartość nie jest uniwersalną regułą i powinna wynikać z planu badania.
| Wartość p | Decyzja | Wniosek |
|---|---|---|
| p < 0,05 | Odrzucenie H0 | Dane dostarczają podstaw do uznania wyniku za statystycznie istotny na poziomie 0,05. |
| p = 0,05 | Porównanie z przyjętą regułą | Trzeba stosować wcześniej określone kryterium, na przykład p ≤ α albo p < α. |
| p > 0,05 | Brak podstaw do odrzucenia H0 | Wynik nie dostarcza wystarczających dowodów przeciwko hipotezie zerowej. |
Wartość p większa lub równa 0,05 nie dowodzi, że H0 jest prawdziwa. Może oznaczać brak efektu, zbyt małą próbę, dużą zmienność danych albo niewłaściwie dobrany test. Z kolei bardzo mała wartość p nie mówi, czy efekt ma znaczenie praktyczne. Do tego potrzebne są między innymi wielkość efektu i przedział ufności.
Notatka ekspercka: p-value nie powinno być obliczane wielokrotnie z wybieraniem najkorzystniejszego wyniku. Testowanie wielu hipotez bez korekty zwiększa ryzyko przypadkowego uzyskania p < 0,05. Takie postępowanie określa się jako p-hacking. Przy wielu porównaniach należy rozważyć odpowiednią korektę, na przykład metodę Bonferroniego.
Najkrótsza reguła brzmi: najpierw określ dane i hipotezę, potem dobierz test oraz jego rozkład, a dopiero na końcu oblicz p-value. W Excelu funkcja T.TEST służy głównie do porównywania średnich, CHISQ.TEST do porównywania częstości, a funkcje rozkładów, takie jak CHISQ.DIST.RT i F.DIST.RT, do przeliczania znanej statystyki testowej na wartość p.
Artykuł ma charakter informacyjny i nie zastępuje konsultacji ze statystykiem przy projektowaniu badania lub interpretacji złożonych modeli, takich jak regresja wieloraka, ANOVA z wieloma czynnikami czy analizy z nietypowym rozkładem danych.