Cos’è un Esempio Pratico di Regressione Lineare?
Definizione: cos’è la regressione lineare
La regressione lineare è un metodo statistico che modella la relazione tra una variabile dipendente (y) e una variabile indipendente (x) utilizzando un’equazione lineare:
[ \hat{y} = a + b x ]
- (\hat{y}) è il valore previsto di (y).
- (a) è l’intercetta.
- (b) è la pendenza.
L’idea principale è che la retta adattata viene scelta in modo da rendere gli errori di previsione il più piccoli possibile secondo un criterio specifico: minimizza la somma dei quadrati dei residui (\sum (y-\hat{y})^2) sui dati di addestramento. I residui sono le differenze tra i valori osservati (y) e i valori previsti (\hat{y}).
Meccanismo: cosa calcola effettivamente un esempio pratico
Un “esempio pratico” significa scegliere un piccolo dataset, dichiarare ogni ipotesi (inclusa la definizione di (x) e (y)), calcolare (a) e (b), quindi utilizzare la retta stimata per produrre valori adattati e almeno una nuova previsione.
Ipotesi per i calcoli numerici illustrati di seguito:
- Si dispone di osservazioni accoppiate ((x_i, y_i)).
- La forma del modello è corretta per la finestra dati: una relazione lineare tra (x) e (y).
- I coefficienti sono calcolati con il metodo dei minimi quadrati ordinari (OLS): minimizzando i residui al quadrato.
- Trattiamo i valori (x) in ingresso come dati (nessun modello aggiuntivo di incertezza per (x)).
- L’esempio è puramente illustrativo; non utilizza dati di mercato in tempo reale.
Evidenza: un esempio numerico completo
Supponiamo di osservare 4 punti:
- (x: 1, 2, 3, 4)
- (y: 2, 3, 5, 4)
Passo 1: Calcolare le medie. [ \bar{x} = (1+2+3+4)/4 = 2.5 ] [ \bar{y} = (2+3+5+4)/4 = 3.5 ]
Passo 2: Calcolare la pendenza (b). [ b = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} ] Calcolo dei valori della tabella:
- Per (x=1): (x-\bar{x}=-1.5), (y-\bar{y}=-1.5), prodotto = 2.25
- Per (x=2): (x-\bar{x}=-0.5), (y-\bar{y}=-0.5), prodotto = 0.25
- Per (x=3): (x-\bar{x}=0.5), (y-\bar{y}=1.5), prodotto = 0.75
- Per (x=4): (x-\bar{x}=1.5), (y-\bar{y}=0.5), prodotto = 0.75
Somma dei prodotti = (2.25+0.25+0.75+0.75 = 4.0).
Denominatore (\sum (x_i-\bar{x})^2):
- ((-1.5)^2=2.25), ((-0.5)^2=0.25), ((0.5)^2=0.25), ((1.5)^2=2.25)
Somma = (2.25+0.25+0.25+2.25 = 5.0).
Quindi: [ b = 4.0/5.0 = 0.8 ]
Passo 3: Calcolare l’intercetta (a). [ a = \bar{y} - b\bar{x} = 3.5 - 0.8\cdot 2.5 = 3.5 - 2.0 = 1.5 ]
Passo 4: Scrivere la retta stimata. [ \hat{y} = 1.5 + 0.8x ]
Passo 5: Calcolare i valori stimati per gli (x) osservati.
- Se (x=1), (\hat{y}=2.3)
- Se (x=2), (\hat{y}=3.1)
- Se (x=3), (\hat{y}=3.9)
- Se (x=4), (\hat{y}=4.7)
Passo 6 (una semplice previsione): Per un nuovo (x=5), [ \hat{y}=1.5+0.8\cdot 5=5.5 ]
Ogni numero sopra può essere verificato indipendentemente ricalcolando le somme e le formule OLS.
Limitazioni e rischi: cosa può far fallire la regressione lineare
La regressione lineare non garantisce previsioni accurate. Le limitazioni principali includono:
- L’ipotesi di linearità potrebbe essere errata. Se la vera relazione tra (x) e (y) è curvilinea, una retta può mancare sistematicamente il modello.
- Sensibilità agli outlier. Un singolo valore estremo di (y) (o un valore di (x) influente molto distante dalla media) può spostare la pendenza e l’intercetta.
- Le relazioni storiche potrebbero non persistere. Anche se la retta adattata corrisponde ai dati di addestramento, il futuro potrebbe comportarsi diversamente perché il processo generatore dei dati può cambiare.
- Variabili omesse. Se (y) dipende da altri fattori non rappresentati da (x), gli errori possono essere strutturati anziché casuali.
- Dati rumorosi ed errori del modello. Minimizzare i residui al quadrato migliora un certo concetto di adattamento, ma non garantisce buone prestazioni in condizioni diverse.
Questi problemi sono generali per la modellazione statistica: i risultati variano in base alle proprietà dei dati e al modo in cui sono stati raccolti ed elaborati.