Como a Regressão Linear é Calculada
Regressão linear, em termos simples
A regressão linear é um método para modelar uma relação entre duas quantidades:
- x: a entrada (variável independente)
- y: a saída (variável dependente)
O modelo assume que, em média, y muda aproximadamente em um padrão de linha reta conforme x muda. “Aproximadamente” é importante: os dados quase nunca seguem uma linha exata, então o modelo inclui um termo de erro.
A versão mais comum é a de mínimos quadrados ordinários (OLS), que escolhe a linha reta que torna os erros gerais de previsão os menores possíveis.
O cálculo: modelo e fórmula
O modelo de regressão linear é escrito como:
[ \hat{y} = a + b x ]
Onde:
- (\hat{y}) é o valor previsto de y
- (a) é o intercepto (o y previsto quando x = 0)
- (b) é a inclinação (quanto (\hat{y}) muda quando x aumenta em 1)
Para calcular a e b, o OLS usa a ideia de minimizar a soma dos quadrados dos resíduos.
Resíduos e o objetivo dos mínimos quadrados
Para pontos de dados ((x_i, y_i)) com (i=1,2,\dots,n):
- Resíduo: (e_i = y_i - \hat{y}_i)
- Soma dos quadrados dos resíduos: (\sum_{i=1}^{n} e_i^2)
O OLS escolhe (a) e (b) para minimizar essa soma.
Inclinação (b)
Uma forma computacional amplamente usada para a inclinação é:
[ b = \frac{\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\sum_{i=1}^{n}(x_i-\bar{x})^2} ]
Aqui:
- (\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i)
- (\bar{y} = \frac{1}{n}\sum_{i=1}^{n} y_i)
Intuição: o numerador é o movimento conjunto de x e y (como os desvios de x se alinham com os desvios de y). O denominador é a dispersão de x em torno de sua média.
Intercepto (a)
Uma vez que (b) é conhecido, o intercepto segue do requisito de que a linha ajustada passe pelo ponto ((\bar{x},\bar{y})):
[ a = \bar{y} - b\bar{x} ]
Quais dados você precisa (e o que deve ser verdadeiro)
Para calcular uma regressão linear simples, você precisa de:
- Um conjunto de observações pareadas ((x_i, y_i)) para (i=1\ldots n).
- Variação suficiente em x, o que significa (\sum (x_i-\bar{x})^2 \neq 0). Se todos os valores de x forem iguais, a inclinação é indefinida.
- Um significado claro de x e y para o seu caso de uso. O modelo sempre produz previsões; ele não informa automaticamente que a relação é causal.
Premissas por trás do ajuste de “linha reta”
Os cálculos de OLS vêm com premissas que afetam a interpretação:
- A forma de linha (a + bx) é uma aproximação apropriada para o padrão dos dados.
- Os erros são tipicamente tratados como não relacionados a x (mais precisamente, o resíduo esperado dado x é frequentemente assumido como 0).
- Os resíduos não devem mostrar estrutura sistemática; se mostrarem, uma linha reta pode ser uma escolha ruim.
Essas são premissas sobre como os dados se comportam, não sobre o futuro.
Uma verificação prática com um pequeno exemplo (sem software especial)
Suponha que você tenha 3 pontos:
((x_1,y_1),(x_2,y_2),(x_3,y_3)). Para calcular a linha de regressão:
- Calcule (\bar{x}) e (\bar{y}).
- Calcule o numerador:
(\sum (x_i-\bar{x})(y_i-\bar{y})). - Calcule o denominador:
(\sum (x_i-\bar{x})^2). - Calcule (b) como numerador ÷ denominador.
- Calcule (a = \bar{y} - b\bar{x}).
Para verificar, calcule cada valor ajustado (\hat{y}_i = a + b x_i), depois calcule os resíduos (e_i = y_i-\hat{y}_i). Se os resíduos forem grandes ou mostrarem um padrão de curva em vez de serem aleatórios, isso indica que a forma linear simples pode não corresponder bem aos dados.
Limitações e modos de falha
Mesmo que a aritmética seja direta, a regressão linear pode ser enganosa quando os dados violam a ideia por trás do modelo.
1) Relações não lineares
Se a relação verdadeira for curva (por exemplo, sobe e depois desce), uma linha reta fará uma média desse comportamento. A saída pode ainda minimizar os erros quadráticos, mas pode esconder estrutura importante.
2) Outliers podem dominar
Como os erros são elevados ao quadrado no objetivo, pontos extremos podem influenciar fortemente (a) e (b). Uma única observação incomum pode deslocar a linha ajustada consideravelmente.
3) x deve variar
Se x não tiver dispersão (todos os valores de x idênticos), o denominador na fórmula da inclinação se torna zero. Nesse caso, você não pode calcular uma inclinação significativa.
4) “Bom ajuste” não implica utilidade futura
Padrões históricos podem mudar. Uma regressão ajustada em dados passados descreve como os dados se comportaram naquele conjunto de dados; ela não prova que o mesmo padrão persistirá.
Verificação: como verificar seu resultado de forma independente
Para verificar de forma independente uma regressão linear calculada, você pode:
- Recalcular (\bar{x}) e (\bar{y}).
- Recalcular a inclinação (b) usando a forma de desvio.
- Recalcular o intercepto (a = \bar{y}-b\bar{x}).
- Gerar valores ajustados (\hat{y}_i) e resíduos (e_i).
- Inspecionar os resíduos:
- Eles são em sua maioria pequenos?
- Eles parecem dispersos aleatoriamente ou mostram padrões sistemáticos?
Se qualquer valor calculado não corresponder ao seu recálculo, o provável problema é uma incompatibilidade de entrada (pareamento x/y diferente, mistura de unidades ou ordenação errada), não as fórmulas de regressão.
Próxima pergunta para esclarecer
Antes de aplicar ou interpretar uma regressão linear, é útil esclarecer o que x representa e se uma aproximação de linha reta é razoável para esses dados. Se você quiser ir mais longe, comparar a regressão linear a ideias relacionadas, como correlação ou diferentes tipos de regressão (por exemplo, modelos com mais preditores), pode esclarecer o que muda no cálculo e o que permanece o mesmo.