Respuesta directa: ¿qué es el R cuadrado?
El R cuadrado (a menudo escrito R²) es un número que describe cuánta variación en un objetivo observado (la variable dependiente) es explicada por un conjunto de predicciones ajustadas (la salida del modelo). En su forma más común, el R² se calcula a partir de dos cantidades:
- Variación total en los datos observados
- Variación residual (no explicada) después de usar las predicciones ajustadas
Interpretación, en términos simples: si la variación residual es pequeña en comparación con la variación total, el R² es más alto; si la variación residual es grande, el R² es más bajo.
Mecanismo: la fórmula y cada entrada requerida
1) Definir los datos
Para calcular el R² necesitas una colección de valores observados y los correspondientes valores ajustados (predichos).
- Valores observados: (y_1, y_2, \dots, y_n)
- Valores ajustados (predichos): (\hat{y}_1, \hat{y}_2, \dots, \hat{y}_n)
- La media muestral de los valores observados: (\bar{y} = \frac{1}{n}\sum_{i=1}^{n} y_i)
Donde (n) es el número de puntos de datos que estás evaluando.
2) Calcular las sumas de cuadrados
El R² utiliza sumas de cuadrados basadas en diferencias respecto a las medias y diferencias respecto a las predicciones ajustadas.
-
Suma total de cuadrados (variación alrededor de la media): [ \mathrm{SST} = \sum_{i=1}^{n} (y_i - \bar{y})^2 ]
-
Suma residual de cuadrados (variación restante después del ajuste): [ \mathrm{SSE} = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 ]
3) Calcular el R cuadrado
En la definición más común: [ R^2 = 1 - \frac{\mathrm{SSE}}{\mathrm{SST}} ]
Esto requiere que (\mathrm{SST} > 0). Si todos los (y_i) observados son idénticos, entonces (\mathrm{SST}=0) y el R² no está definido de manera significativa en esta forma.
4) Elección práctica clave: ¿sobre qué datos se calculan los (\hat{y})?
La fórmula en sí no especifica si los (\hat{y}) provienen de:
- los mismos datos utilizados para ajustar el modelo (dentro de la muestra), o
- datos separados no utilizados durante el ajuste (fuera de la muestra)
Usar valores ajustados dentro de la muestra a menudo infla el rendimiento para modelos flexibles. Usar predicciones fuera de la muestra generalmente da una sensación más realista de qué tan bien se generaliza la relación, pero puede reducir el R² incluso cuando el modelo es direccionalmente útil.
Evidencia o ejemplo: un cálculo concreto (con supuestos explícitos)
Supón que tienes (n=3) valores observados (y) y un modelo que produce valores ajustados (\hat{y}) para los mismos tres puntos.
Sea:
- (y = [2,\ 4,\ 6])
- (\hat{y} = [2,\ 5,\ 5])
Paso 1: calcular la media [ \bar{y} = (2+4+6)/3 = 4 ]
Paso 2: calcular (\mathrm{SST}) [ \mathrm{SST} = (2-4)^2 + (4-4)^2 + (6-4)^2 = 4 + 0 + 4 = 8 ]
Paso 3: calcular (\mathrm{SSE}) [ \mathrm{SSE} = (2-2)^2 + (4-5)^2 + (6-5)^2 = 0 + 1 + 1 = 2 ]
Paso 4: calcular el R² [ R^2 = 1 - 2/8 = 1 - 0.25 = 0.75 ]
Bajo este cálculo, 0.75 indica que la variación residual es una cuarta parte de la variación total (para esta configuración de evaluación).
Limitaciones y modos de fallo: lo que el R cuadrado puede hacer mal
El R² es ampliamente utilizado, pero no es una garantía de utilidad. Varias limitaciones importantes pueden hacer que sea engañoso.
1) Sobreajuste cuando se evalúa dentro de la muestra
Si un modelo es flexible y calculas el R² usando valores ajustados en el mismo conjunto de datos del que aprendió, los errores residuales pueden ser artificialmente pequeños. Esto puede producir un R² alto incluso cuando el modelo no captura una relación estable.
2) Desajuste de no linealidad
El R² mide qué tan bien los valores predichos coinciden con los valores observados a través de los residuos. No asegura que la relación subyacente tenga una estructura particular (por ejemplo, linealidad) a menos que tu enfoque de modelado imponga esa estructura.
Un modelo puede mostrar un R² moderado o alto mientras sigue siendo inapropiado para la extrapolación más allá del rango de datos, porque el R² es descriptivo para el conjunto de evaluación, no una ley universal.
3) Efectos de escala y preprocesamiento
Debido a que SST y SSE dependen de la escala de (y), los pasos de preprocesamiento (como diferenciación, normalización o transformaciones) pueden cambiar el R². Dos analistas que trabajan con diferentes transformaciones pueden terminar con valores de R² diferentes incluso si la “calidad” del ajuste es comparable.
4) El R² puede ser indefinido o poco intuitivo
- Si (\mathrm{SST}=0), la fórmula se rompe.
- Dependiendo de cómo se produzcan las predicciones y de si usas definiciones alternativas (como variantes ajustadas), el valor puede ser menos intuitivo que el “porcentaje explicado”.
5) Relación vs. causalidad
El R² cuantifica qué tan cerca siguen las predicciones a las observaciones. No establece por qué existe la relación. Incluso con un R² alto, la asociación podría reflejar factores compartidos, artefactos de datos o patrones coincidentes.
Verificación y siguiente pregunta: cómo comprobar de forma independiente un R cuadrado reportado
Si ves un R² reportado, puedes verificar el cálculo comprobando estos hechos, sin depender de afirmaciones sobre el rendimiento futuro:
- Confirma el tamaño del conjunto de datos de evaluación (n).
- Obtén los valores observados (y_i).
- Identifica los valores ajustados/predichos (\hat{y}_i) utilizados para calcular los errores residuales.
- Recalcula (\bar{y}), SST, SSE y luego (R^2 = 1 - \mathrm{SSE}/\mathrm{SST}).
Si el proveedor o la calculadora no indica qué (\hat{y}) se utilizan (dentro de la muestra vs. fuera de la muestra) y qué preprocesamiento se aplicó, el R² reportado sigue estando matemáticamente definido, pero la comparación entre configuraciones se vuelve incierta.
Una pregunta de seguimiento útil es cómo difiere el R² cuando se calcula para nociones relacionadas (por ejemplo, usando diferentes divisiones de evaluación o formas de modelado), porque esas elecciones cambian lo que el R² realmente mide.