Współczynnik determinacji – jak obliczyć go krok po kroku?
Współczynnik determinacji R2 pokazuje, jaka część zmienności zmiennej zależnej jest wyjaśniana przez model regresji. Aby go obliczyć, dzieli się zmienność wyjaśnioną przez model przez całkowitą zmienność obserwowanej zmiennej.
Czym jest współczynnik determinacji?
Współczynnik determinacji, nazywany także R-kwadrat, jest miarą dopasowania modelu regresji do danych. Wartość R2 równa 0,70 oznacza, że model wyjaśnia 70% zmienności zmiennej zależnej w analizowanej próbie. Pozostałe 30% wynika z innych czynników, błędu pomiaru lub losowych różnic, których model nie uwzględnia.
W typowym modelu regresji liniowej z wyrazem wolnym R2 mieści się w przedziale od 0 do 1. Im bliżej jedności, tym lepiej model odtwarza zróżnicowanie obserwowanych wartości. Nie oznacza to jednak, że model dowodzi istnienia zależności przyczynowej ani że równie dobrze zadziała na nowych danych.
Wzór na współczynnik determinacji
Współczynnik można obliczyć za pomocą wzoru:
\[ R^2 = \frac{SS_M}{SS_T} = \frac{\sum_{t=1}^{n}(\hat{y}_t-\bar{y})^2}{\sum_{t=1}^{n}(y_t-\bar{y})^2} \]
Licznik opisuje zmienność wyjaśnioną przez model, a mianownik – całkowitą zmienność rzeczywistych obserwacji względem ich średniej.
| Symbol | Nazwa | Opis |
|---|---|---|
| SSM | Suma kwadratów dla modelu | Zmienność zmiennej zależnej wyjaśniona przez model. |
| SST | Suma kwadratów całkowita | Całkowita zmienność obserwowanych wartości względem średniej. |
| yt | Wartość rzeczywista | Zmierzona wartość zmiennej zależnej dla obserwacji t. |
| ŷt | Wartość przewidywana | Wartość wyznaczona przez model regresji. |
| ȳ | Średnia wartość | Średnia arytmetyczna rzeczywistych wartości zmiennej zależnej. |
W regresji liniowej z jedną zmienną objaśniającą i wyrazem wolnym R2 jest równe kwadratowi współczynnika korelacji Pearsona: \(R^2=r^2\). Nie należy jednak utożsamiać obu miar. Korelacja Pearsona może być dodatnia lub ujemna, natomiast po podniesieniu do kwadratu R2 nie pokazuje kierunku zależności.
Jak obliczyć R2 krok po kroku?
Do obliczeń potrzebujesz rzeczywistych wartości zmiennej zależnej oraz wartości przewidywanych przez dopasowany model. Procedura wygląda następująco:
- Oblicz średnią ȳ – dodaj wszystkie rzeczywiste wartości y i podziel sumę przez liczbę obserwacji.
- Oblicz SST – dla każdej obserwacji odejmij średnią od yt, podnieś wynik do kwadratu i zsumuj: \(SS_T=\sum(y_t-\bar{y})^2\).
- Wyznacz wartości przewidywane ŷt – podstaw dane wejściowe do równania regresji.
- Oblicz SSM – odejmij średnią ȳ od każdej wartości przewidywanej, podnieś różnice do kwadratu i zsumuj: \(SS_M=\sum(\hat{y}_t-\bar{y})^2\).
- Podziel SSM przez SST – otrzymany iloraz jest wartością R2. Aby wyrazić wynik w procentach, pomnóż go przez 100.
Przykładowo, jeżeli \(SS_M=84\), a \(SS_T=120\), to \(R^2=84/120=0{,}70\). Model wyjaśnia więc 70% zmienności zmiennej zależnej w badanej próbie.
Jak interpretować wartość R2?
Poniższe przedziały mogą służyć jako orientacyjna skala, ale nie są uniwersalnym standardem. W naukach społecznych, ekonomii, biologii czy inżynierii akceptowalne wartości mogą znacząco się różnić.
| Zakres R2 | Orientacyjna ocena dopasowania |
|---|---|
| 0,90–1,00 | Bardzo dobre dopasowanie |
| 0,80–0,90 | Dobre dopasowanie |
| 0,60–0,80 | Zadowalające dopasowanie w części zastosowań |
| Poniżej 0,50 | Słabe dopasowanie, choć może być wystarczające do opisu zależności |
R2=0 oznacza, że model nie wyjaśnia zmienności lepiej niż proste wykorzystanie średniej zmiennej zależnej. R2=1 oznacza pełne dopasowanie obserwacji do wartości przewidywanych, co w danych rzeczywistych może sygnalizować także nadmierne dopasowanie.
Ograniczenia i pułapki
Wysoki R2 nie wystarcza, aby uznać model za poprawny. Przy interpretacji trzeba uwzględnić kilka ograniczeń:
- Brak dowodu przyczynowości – wysoka wartość R2 opisuje współzmienność i dopasowanie, ale nie dowodzi, że zmienne objaśniające powodują zmiany zmiennej zależnej.
- Zależność od liczby zmiennych – dodanie kolejnej zmiennej do modelu nie zmniejsza zwykłego R2, nawet gdy jej wkład merytoryczny jest niewielki.
- Nadmierne dopasowanie – model może bardzo dobrze opisywać próbę uczącą, lecz słabo przewidywać wartości spoza tej próby.
- Efekt katalizy – wysoki R2 może pojawić się mimo braku przekonującego uzasadnienia merytorycznego dla siły obserwowanego powiązania.
- Brak informacji o resztach – sam współczynnik nie pokazuje rozkładu błędów, obserwacji odstających ani naruszenia założeń regresji.
Przy wielu zmiennych objaśniających warto sprawdzić skorygowany R2. Uwzględnia on liczbę zmiennych i liczebność próby, dlatego może obniżyć ocenę modelu, gdy dodanie kolejnego predyktora nie poprawia dopasowania wystarczająco. R2 najlepiej analizować razem z oceną reszt, błędami prognoz i wynikami uzyskanymi na danych poza próbą.
Najkrócej: aby obliczyć współczynnik determinacji, podziel SSM przez SST. Wynik mówi, jaki odsetek zmienności wyjaśnia model w analizowanej próbie, ale nie zastępuje oceny przyczynowości ani sprawdzenia jakości prognoz.