Quais dados são necessários para avaliar o R Quadrado?
Defina o R Quadrado antes de coletar dados
O R Quadrado (frequentemente escrito R²) é um número resumo que compara o quão bem as previsões de um modelo correspondem aos resultados observados. A ideia usual é: quanto da variação na variável dependente observada é explicada pelo modelo, em relação a uma linha de base que prevê algo como a média.
Para avaliar o R Quadrado, você primeiro precisa saber a definição exata que está sendo usada (por exemplo, se é calculado a partir da soma total dos quadrados e da soma residual dos quadrados da maneira padrão, e se alguma variante “ajustada” é usada). Implementações diferentes podem relatar números diferentes mesmo quando os dados subjacentes são semelhantes.
Entradas de dados necessárias
No mínimo, você precisa de todas as informações necessárias para reproduzir o lado dependente do cálculo.
- Série da variável dependente observada
- As observações indexadas no tempo que formam os valores de y.
- A frequência de amostragem (por exemplo, a cada tick, a cada minuto, diária), incluindo as unidades.
- As regras de alinhamento temporal (quando cada valor de y é considerado “correspondente” aos preditores).
- Valores previstos ou o modelo ajustado Você tem duas opções:
- Valores previstos: os valores previstos de y-hat do modelo para os mesmos pontos no tempo, com a mesma ordenação.
- Ou, as entradas do modelo necessárias para gerar y-hat: a série de preditores (valores de x), o método de estimação e os parâmetros produzidos pelo ajuste.
- A linha de base usada no denominador A maioria das fórmulas de R² usa uma linha de base que reflete a variação em torno da média da variável dependente observada. Para avaliar o R² corretamente, você deve saber qual linha de base é usada e se a média é calculada na mesma divisão do conjunto de dados que os resíduos.
Verificações de proveniência e pré-processamento
O R² não é apenas uma fórmula; ele depende do que entrou na série.
Verifique e registre:
- Proveniência dos dados: de onde os dados vieram (feed ou fonte) e como foram obtidos.
- Regras de filtragem de dados: se observações foram removidas devido a erros, feriados, outliers ou baixa liquidez.
- Tratamento de valores ausentes: se lacunas foram descartadas, preenchidas para frente, interpoladas ou tratadas de outra forma.
- Transformações: se alguma escala, transformação logarítmica, diferenciação ou normalização foi aplicada e se foi consistente entre os períodos de treino e avaliação.
Risco material: se x e y forem pré-processados de forma diferente, ou se os carimbos de data/hora estiverem desalinhados, o R² pode parecer maior ou menor por razões não relacionadas ao poder explicativo genuíno.
Atualidade e premissas de divisão
Para avaliar se um valor de R² é significativo, você precisa saber como o tempo foi usado.
Você deve documentar:
- Se o R² foi calculado nos mesmos dados usados para ajustar o modelo ou em dados retidos (held-out).
- A janela de tempo específica usada para o ajuste versus a avaliação.
- Se uma abordagem de janela móvel ou expansiva foi usada (a abordagem muda o significado do resultado relatado).
Um modo de falha comum é tratar o R² in-sample como se descrevesse relações futuras. As relações históricas podem mudar quando o comportamento do mercado se altera, então o mesmo método pode produzir um R² diferente em dados posteriores.
Evidência ou exemplo: o que você pode verificar de forma independente
Uma lista de verificação de verificação independente deve incluir:
- Confirmar a série y exata usada (carimbos de data/hora, unidades e filtragem).
- Confirmar se o valor relatado usou previsões y-hat ou previsões recalculadas a partir dos parâmetros do modelo armazenados.
- Confirmar a definição exata de R² (e se o R² ajustado foi usado).
- Recalcular o R² a partir dos números fornecidos (y, y-hat, resíduos) usando a fórmula declarada e a mesma divisão do conjunto de dados.
Se qualquer um desses itens estiver faltando, o R² relatado não pode ser totalmente auditado, porque muitos detalhes de implementação alteram o resultado.
Limitações e riscos (modos de falha materiais)
Pelo menos uma limitação a observar:
- Dependência do modelo: o R² reflete o ajuste sob uma forma específica de modelo. Se a relação for não linear ou mudar ao longo do tempo, o mesmo R² pode ser enganoso.
Outras limitações importantes:
- Não estacionariedade: se o processo gerador de dados evoluir, um R² alto em um período pode não se manter posteriormente.
- Overfitting: se o modelo for muito flexível, ele pode se ajustar ao ruído, inflando o R² in-sample.
- Sensibilidade a ruídos e eventos raros: medições ruidosas podem causar R² instável entre janelas de tempo.
- Comparações enganosas: os valores de R² podem ser difíceis de comparar entre modelos se o pré-processamento, os conjuntos de características ou as divisões de avaliação diferirem.