O que é um Exemplo Prático de R Quadrado?
Resposta direta
Um exemplo prático de R quadrado (R²) começa com um pequeno conjunto de dados, calcula os valores previstos do modelo e então compara duas quantidades: (1) a variação explicada pelo modelo e (2) a variação total nos resultados observados. R² é a proporção da variação explicada em relação à variação total, definida como
R² = 1 − (SSres / SStot)
onde SSres é a soma dos quadrados dos resíduos e SStot é a soma total dos quadrados em torno da média.
Abaixo está um exemplo totalmente numérico. Ele não assume nenhum dado de mercado ao vivo.
Mecanismo ou definição
Para tornar o cálculo explícito, defina uma variável dependente y (valores observados) e um conjunto de previsões do modelo ŷ para os mesmos pontos no tempo.
- Calcule a média dos valores observados: ȳ = média(y).
- Calcule a soma total dos quadrados (SStot): SStot = Σ(yi − ȳ)²
- Calcule os resíduos e a soma dos quadrados dos resíduos (SSres): SSres = Σ(yi − ŷi)²
- Converta para R²: R² = 1 − SSres / SStot
Interpretação em termos simples: R² aumenta quando as previsões do modelo permanecem próximas dos valores observados (resíduos pequenos) em relação ao quão longe as observações variam em torno de sua média (grande variação total).
Evidência ou exemplo
Suponha que temos 4 resultados observados y e um conjunto simples de previsões ŷ produzido por algum modelo.
Seja:
- y = [2, 0, 4, 6]
- ŷ = [2, 1, 3, 5]
Premissas:
- As previsões ŷ correspondem aos mesmos quatro casos que y.
- Estamos usando a definição padrão de R² como variação explicada.
- Nenhum custo, efeito de execução ou comportamento futuro está incluído; isso é puramente um resumo aritmético do ajuste a esses quatro pontos.
Etapa 1: Média de y ȳ = (2 + 0 + 4 + 6) / 4 = 12/4 = 3
Etapa 2: Soma total dos quadrados (SStot)
- (2 − 3)² = 1
- (0 − 3)² = 9
- (4 − 3)² = 1
- (6 − 3)² = 9 Portanto, SStot = 1 + 9 + 1 + 9 = 20
Etapa 3: Resíduos e SSres Resíduos (yi − ŷi):
- 2 − 2 = 0 → ao quadrado: 0
- 0 − 1 = −1 → ao quadrado: 1
- 4 − 3 = 1 → ao quadrado: 1
- 6 − 5 = 1 → ao quadrado: 1 Portanto, SSres = 0 + 1 + 1 + 1 = 3
Etapa 4: Calcule R² R² = 1 − SSres / SStot = 1 − 3/20 = 17/20 = 0,85
Resultado: Para este conjunto de dados e estas previsões, R² = 0,85. Isso significa que o erro residual é muito menor do que a variabilidade de y em torno de sua média.
Limitações e riscos
- R² não é causalidade. Um R² alto pode ocorrer mesmo se o modelo capturar padrões sem explicar por que eles ocorrem.
- R² depende do y escolhido e de como ŷ é produzido. Se você alterar a forma do modelo, os dados de treinamento ou o pré-processamento, R² pode mudar.
- Risco de sobreajuste: Um modelo pode se ajustar bem a pontos históricos (R² alto na amostra) e ainda assim generalizar mal. Relações históricas não estabelecem resultados futuros.
- Sensibilidade ao conjunto de dados: Se SStot for pequeno (valores de y agrupados perto de sua média), R² pode se tornar instável ou enganoso.
- Modo de falha com dados fora da amostra: R² calculado em novos dados pode ser muito menor do que os valores na amostra porque os resíduos geralmente aumentam quando a relação muda.
Verificação ou próxima pergunta
Você pode verificar independentemente qualquer valor de R² recalculando os três ingredientes: ȳ, SStot e SSres usando o mesmo y observado e o mesmo ŷ previsto. Se quiser ir mais longe, uma próxima pergunta útil é como R² se comporta quando as previsões vêm de diferentes janelas, diferentes escalas ou diferentes escolhas de modelo—especialmente quando as relações não são estáveis ao longo do tempo.