Jak obliczyć regresję liniową? Poradnik krok po kroku
Regresja liniowa pozwala przewidywać wartość zmiennej zależnej Y na podstawie zmiennej niezależnej X. W praktyce dopasowuje do punktów prostą o równaniu y = ax + b, wybierając takie parametry, aby suma kwadratów błędów była możliwie mała.
Czym jest regresja liniowa?
Załóżmy, że chcesz oszacować sprzedaż na podstawie liczby miesięcy prowadzenia działalności albo cenę samochodu na podstawie jego wieku. W obu przypadkach masz zmienną, którą chcesz przewidzieć, oraz zmienną, która ma pomóc w obliczeniu prognozy.
Zmienna zależna Y to wynik prognozy, na przykład sprzedaż lub cena. Zmienna niezależna X jest predyktorem, czyli informacją wykorzystywaną do wyznaczenia Y. Regresja liniowa dopasowuje do obserwacji prostą, która możliwie dobrze opisuje zależność między tymi zmiennymi.
Równanie prostej regresji
Równanie prostej regresji liniowej zapisuje się następująco:
y = ax + b
Poszczególne symbole oznaczają:
- y – przewidywaną wartość zmiennej zależnej
- x – wartość zmiennej niezależnej, czyli predyktora
- a – współczynnik kierunkowy, który pokazuje nachylenie prostej
- b – wyraz wolny, czyli przewidywaną wartość y dla x = 0
W niektórych podręcznikach oznaczenia są zamienione i współczynnik kierunkowy występuje jako b, a wyraz wolny jako a. Dlatego przed rozpoczęciem obliczeń sprawdź definicję symboli. W tym poradniku korzystamy z zapisu y = ax + b.
Jak obliczyć regresję liniową krok po kroku?
Parametry prostej wyznacza się najczęściej za pomocą metody najmniejszych kwadratów. Polega ona na znalezieniu takiej prostej, dla której suma kwadratów różnic między wartościami rzeczywistymi a przewidywanymi jest najmniejsza.
Jeżeli obserwacja ma wartość rzeczywistą yi, a model przewiduje dla niej wartość ŷi, to różnica yi – ŷi jest resztą modelu. Podnoszenie tych różnic do kwadratu sprawia, że dodatnie i ujemne błędy nie znoszą się wzajemnie.
Obliczenia wykonasz w następujących etapach:
- Oblicz średnie dla X i Y – wyznacz średnią wartość zmiennej niezależnej x̄ oraz średnią wartość zmiennej zależnej ȳ.
- Wyznacz odchylenia od średnich – dla każdej obserwacji oblicz xi – x̄ oraz yi – ȳ.
- Oblicz sumę iloczynów odchyleń – zsumuj wartości (xi – x̄)(yi – ȳ).
- Oblicz sumę kwadratów odchyleń X – zsumuj wartości (xi – x̄)2.
- Wyznacz współczynnik kierunkowy – podziel pierwszą sumę przez drugą.
- Wyznacz wyraz wolny – podstaw otrzymane wartości do wzoru b = ȳ – ax̄.
Współczynnik kierunkowy oblicza się ze wzoru:
a = Σ[(xi – x̄)(yi – ȳ)] / Σ[(xi – x̄)2]
Następnie oblicz wyraz wolny:
b = ȳ – ax̄
Po wyznaczeniu obu parametrów otrzymujesz równanie regresji. Przykładowo, jeśli a = 2,4 i b = 15, model ma postać y = 2,4x + 15. Dla x = 10 przewidywana wartość y wynosi 39.
Jak interpretować współczynniki regresji?
Sam wzór nie wystarcza do podjęcia decyzji. Najważniejsze jest odczytanie, co oznaczają parametry w jednostkach analizowanego problemu.
| Współczynnik | Nazwa | Interpretacja |
|---|---|---|
| a | Współczynnik kierunkowy | Przeciętna zmiana Y, gdy X zwiększa się o jedną jednostkę. Wartość dodatnia oznacza wzrost Y, a ujemna spadek Y. |
| b | Wyraz wolny | Przewidywana wartość Y dla X = 0. Ma sens tylko wtedy, gdy wartość X = 0 jest możliwa i znajduje się w kontekście analizowanych danych. |
Przykładowo, model opisujący cenę samochodu może mieć postać: cena = 104 029 – 9860 × wiek. Współczynnik kierunkowy oznacza wtedy, że każdy kolejny rok wieku wiąże się średnio ze spadkiem przewidywanej ceny o 9860 zł.
Wyraz wolny 104 029 zł można odczytać jako przewidywaną cenę samochodu dla wieku równego zero. Nie musi to jednak oznaczać rzeczywistej ceny każdego nowego samochodu. Jest to punkt przecięcia prostej z osią Y, a jego interpretacja bywa ograniczona, gdy X = 0 nie występuje w danych albo nie ma sensu biznesowego.
Nie należy też mylić zależności statystycznej z przyczynowością. Dodatni współczynnik kierunkowy pokazuje współzmienność w modelu, ale sam w sobie nie dowodzi, że zmiana X powoduje zmianę Y.
Regresja liniowa w Excelu
Ręczne liczenie jest przydatne do zrozumienia metody, ale przy większej liczbie obserwacji lepiej użyć arkusza kalkulacyjnego. W Excelu służy do tego funkcja REGLINP, która wykorzystuje metodę najmniejszych kwadratów.
Dla jednej zmiennej niezależnej podstawowa składnia wygląda tak:
=REGLINP(znane_y; znane_x)
Zakres znane_y powinien zawierać wartości zmiennej zależnej, a zakres znane_x wartości predyktora. Wynikiem są współczynnik kierunkowy oraz wyraz wolny. W praktyce można użyć także argumentu statystyki:
=REGLINP(znane_y; znane_x; PRAWDA; PRAWDA)
Wtedy Excel zwraca również między innymi współczynnik determinacji R2, błędy standardowe, statystykę F i sumy kwadratów. Przy jednej zmiennej można też skorzystać z funkcji NACHYLENIE i ODCIĘTA, ale REGLINP dostarcza szerszego zestawu informacji.
Kiedy regresja liniowa działa?
Przed interpretacją modelu sprawdź, czy dane spełniają podstawowe założenia. Najważniejsze z nich to:
- Liniowość – zależność między X i Y powinna być w przybliżeniu liniowa, a nie na przykład wyraźnie zakrzywiona.
- Niezależność obserwacji – błąd jednej obserwacji nie powinien wpływać na błąd kolejnej.
- Homoskedastyczność – rozrzut reszt powinien być podobny dla małych i dużych wartości X.
- Brak silnego wpływu wartości odstających – pojedyncze nietypowe punkty nie powinny całkowicie zmieniać nachylenia prostej.
Założenia ocenia się między innymi na wykresie rozrzutu i wykresach reszt. Test Breuscha-Pagana może pomóc w ocenie homoskedastyczności, a test Shapiro-Wilka służy do sprawdzania normalności reszt. Testy nie zastępują jednak oglądu danych, szczególnie przy małych zbiorach.
Współczynnik determinacji R2 informuje, jaka część zmienności Y jest opisana przez model. Jego wyższa wartość zwykle oznacza lepsze dopasowanie w obrębie analizowanych danych, ale nie gwarantuje dobrych prognoz dla nowych obserwacji.
Największa ostrożność jest potrzebna przy ekstrapolacji, czyli przewidywaniu wartości poza zakresem X wykorzystanym do budowy modelu. Prosta może dobrze opisywać dane między najmniejszą a największą obserwacją, lecz poza tym zakresem zależność może przestać być liniowa.
Regresja liniowa jest użyteczna, gdy zależność ma rozsądne przybliżenie liniowe, a obserwacje są wystarczająco dobrej jakości. W przypadku wielu predyktorów, silnej współliniowości lub dużej liczby wartości odstających potrzebna jest szersza diagnostyka modelu.
Najkrócej: aby obliczyć regresję liniową, wyznacz średnie X i Y, policz współczynnik kierunkowy a, oblicz wyraz wolny b, a następnie zinterpretuj wynik w zakresie, dla którego zebrano dane.