Co to jest przykład obliczeniowy regresji liniowej?
Definicja: czym jest regresja liniowa
Regresja liniowa to metoda statystyczna, która modeluje zależność między zmienną zależną (y) a jedną zmienną niezależną (x) za pomocą równania linii prostej:
[ \hat{y} = a + b x ]
- (\hat{y}) to przewidywana wartość (y).
- (a) to punkt przecięcia z osią.
- (b) to nachylenie.
Kluczową ideą jest to, że dopasowana linia jest wybierana tak, aby błędy predykcji były jak najmniejsze w określony sposób: minimalizuje sumę kwadratów reszt (\sum (y-\hat{y})^2) na danych treningowych. Reszty to różnice między zaobserwowanymi wartościami (y) a przewidywanymi wartościami (\hat{y}).
Mechanizm: co właściwie oblicza przykład obliczeniowy
„Przykład obliczeniowy” oznacza, że wybierasz mały zbiór danych, określasz każde założenie (w tym sposób zdefiniowania (x) i (y)), obliczasz (a) i (b), a następnie używasz dopasowanej linii do wygenerowania wartości dopasowanych i co najmniej jednej nowej predykcji.
Założenia dla poniższych przykładowych obliczeń liczbowych:
- Masz pary obserwacji ((x_i, y_i)).
- Forma modelu jest poprawna dla okna danych: liniowa zależność między (x) i (y).
- Współczynniki są obliczane za pomocą zwykłej metody najmniejszych kwadratów (OLS): minimalizacja kwadratów reszt.
- Traktujemy wartości wejściowe (x) jako dane (bez dodatkowego modelu niepewności dla (x)).
- Przykład ma charakter wyłącznie ilustracyjny; nie wykorzystuje danych rynkowych w czasie rzeczywistym.
Dowód: w pełni liczbowy przykład obliczeniowy
Załóżmy, że obserwujesz 4 punkty:
- (x: 1, 2, 3, 4)
- (y: 2, 3, 5, 4)
Krok 1: Oblicz średnie. [ \bar{x} = (1+2+3+4)/4 = 2.5 ] [ \bar{y} = (2+3+5+4)/4 = 3.5 ]
Krok 2: Oblicz nachylenie (b). [ b = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} ] Oblicz wartości tabelaryczne:
- Dla (x=1): (x-\bar{x}=-1.5), (y-\bar{y}=-1.5), iloczyn = 2.25
- Dla (x=2): (x-\bar{x}=-0.5), (y-\bar{y}=-0.5), iloczyn = 0.25
- Dla (x=3): (x-\bar{x}=0.5), (y-\bar{y}=1.5), iloczyn = 0.75
- Dla (x=4): (x-\bar{x}=1.5), (y-\bar{y}=0.5), iloczyn = 0.75
Suma iloczynów = (2.25+0.25+0.75+0.75 = 4.0).
Mianownik (\sum (x_i-\bar{x})^2):
- ((-1.5)^2=2.25), ((-0.5)^2=0.25), ((0.5)^2=0.25), ((1.5)^2=2.25)
Suma = (2.25+0.25+0.25+2.25 = 5.0).
Zatem: [ b = 4.0/5.0 = 0.8 ]
Krok 3: Oblicz punkt przecięcia (a). [ a = \bar{y} - b\bar{x} = 3.5 - 0.8\cdot 2.5 = 3.5 - 2.0 = 1.5 ]
Krok 4: Zapisz dopasowaną linię. [ \hat{y} = 1.5 + 0.8x ]
Krok 5: Oblicz wartości dopasowane dla zaobserwowanych (x).
- Jeśli (x=1), (\hat{y}=2.3)
- Jeśli (x=2), (\hat{y}=3.1)
- Jeśli (x=3), (\hat{y}=3.9)
- Jeśli (x=4), (\hat{y}=4.7)
Krok 6 (jedna prosta predykcja): Dla nowego (x=5), [ \hat{y}=1.5+0.8\cdot 5=5.5 ]
Każda liczba powyżej może być niezależnie zweryfikowana poprzez ponowne obliczenie sum i wzorów OLS.
Ograniczenia i ryzyka: co może spowodować niepowodzenie regresji liniowej
Regresja liniowa nie gwarantuje dokładnych predykcji. Istotne ograniczenia obejmują:
- Założenie liniowości może być błędne. Jeśli prawdziwa zależność między (x) i (y) jest krzywoliniowa, linia prosta może systematycznie nie trafiać w wzorzec.
- Wrażliwość na obserwacje odstające. Pojedyncza skrajna wartość (y) (lub wpływowa wartość (x) daleka od średniej) może przesunąć nachylenie i punkt przecięcia.
- Zależności historyczne mogą nie być trwałe. Nawet jeśli dopasowana linia pasuje do danych treningowych, przyszłość może zachowywać się inaczej, ponieważ proces generujący dane może się zmienić.
- Pominięte zmienne. Jeśli (y) zależy od innych czynników nieuwzględnionych przez (x), błędy mogą być strukturalne, a nie losowe.
- Zaszumione dane i błąd modelu. Minimalizacja kwadratów reszt poprawia jedno pojęcie dopasowania, ale nie zapewnia dobrej wydajności w różnych warunkach.
Te kwestie są ogólne dla modelowania statystycznego: wyniki różnią się w zależności od właściwości danych oraz sposobu ich gromadzenia i przetwarzania.