Módulo 3 · Sesión 7

03 Multicolinealidad, VIF y regresión polinómica

Regresión Regresión avanzada

Objetivos

  • Entender qué es la multicolinealidad y por qué es el quinto supuesto de 01-regresion-lineal.md que rompe primero en datos reales.
  • Diagnosticarla con la matriz de correlación y, mejor, con el factor de inflación de la varianza (VIF).
  • Distinguir qué daña la multicolinealidad (interpretación) de qué no daña (predicción).
  • Extender el modelo lineal a curvas mediante regresión polinómica, y ver por qué agrava la multicolinealidad casi por construcción.

1. Qué es la multicolinealidad

Un modelo tiene multicolinealidad cuando dos o más predictores están fuertemente correlacionados entre sí. En Ames Housing, gr_liv_area (área habitable), total_bsmt_sf (área de sótano) y garage_area miden, en el fondo, aspectos parecidos de una misma idea: “qué tan grande es la casa”. No es un error de captura de datos — es que las variables del mundo real vienen correlacionadas.

Recordando la ecuación normal de 01-regresion-lineal.md:

β=(XX)1Xy\boldsymbol{\beta} = (\mathbf{X}^{\top}\mathbf{X})^{-1}\mathbf{X}^{\top}\mathbf{y}

Si dos columnas de X\mathbf{X} son casi combinaciones lineales una de la otra, XX\mathbf{X}^{\top}\mathbf{X} se acerca a una matriz singular (no invertible). La inversión sigue siendo posible numéricamente, pero el resultado es inestable: pequeños cambios en los datos —quitar o agregar unas pocas observaciones— pueden producir coeficientes muy distintos, incluso de signo opuesto al esperado.

2. Qué daña la multicolinealidad, y qué no

Esta distinción es la que más se confunde en la práctica:

¿Se ve afectado?Por qué
Predicciones (y^\hat{y})No, o muy pocoEl modelo puede repartir el “crédito” de la predicción entre las variables correlacionadas de formas distintas y aun así predecir igual de bien
R2R^2 y RMSE en testNo, o muy pocoSon función de y^\hat{y}, no de β\boldsymbol{\beta} directamente
Coeficientes individuales βj\beta_jSí, gravementeSe vuelven inestables: cambian mucho entre muestras, pueden tener signo contraintuitivo
Interpretación (“cada metro² adicional de sótano suma $X”)Si βj\beta_j no es estable, esa interpretación no es confiable
Pruebas de hipótesis sobre βj\beta_jLos errores estándar de los coeficientes se inflan, y una variable realmente relevante puede aparecer como “no significativa”

Conclusión práctica: si el objetivo del modelo es predecir (el caso más común en este curso), la multicolinealidad moderada rara vez es motivo de alarma por sí sola. Si el objetivo es interpretar los coeficientes —explicarle a alguien cuánto vale cada metro² adicional—, sí lo es.

3. Diagnóstico: matriz de correlación y VIF

La matriz de correlación es el primer vistazo, pero tiene un punto ciego: solo detecta relaciones entre pares de variables. Una variable puede no estar muy correlacionada con ninguna otra individualmente, y aun así ser casi una combinación lineal de varias combinadas (p. ej. total_bsmt_sf1st_flr_sf cuando el sótano tiene la misma huella que el primer piso, un patrón que ninguna correlación de a pares por sí sola revela).

El factor de inflación de la varianza (VIF) sí lo captura. Para cada predictor xjx_j, se ajusta una regresión de xjx_j contra todos los demás predictores, se obtiene su Rj2R_j^2, y:

VIFj=11Rj2\text{VIF}_j = \frac{1}{1 - R_j^2}

Interpretación: si Rj2=0R_j^2 = 0 (otros predictores no explican nada de xjx_j), VIFj=1\text{VIF}_j=1 — sin colinealidad. Si Rj21R_j^2 \to 1 (xjx_j es casi predecible a partir de las demás), VIFj\text{VIF}_j \to \infty. El nombre viene de que VIFj\text{VIF}_j es literalmente el factor por el que se infla la varianza de β^j\hat{\beta}_j respecto al caso sin colinealidad — de ahí que los coeficientes se vuelvan inestables.

Reglas de dedo habituales: VIF>5\text{VIF} > 5 amerita revisar; VIF>10\text{VIF} > 10 es colinealidad severa. No son umbrales matemáticos exactos, son convenciones — el criterio real depende de si el objetivo es interpretar o predecir (sección 2).

4. Qué hacer cuando el VIF es alto

En orden de qué tan invasiva es la intervención:

  1. Nada, si el objetivo es predecir y las métricas de test son buenas. La multicolinealidad no es un defecto que siempre haya que corregir.
  2. Eliminar una de las variables redundantes, si dos miden casi lo mismo (garage_area y garage_cars suelen estarlo). Se pierde poca información porque la otra variable ya la captura.
  3. Combinar variables en una sola (p. ej. área total = gr_liv_area + total_bsmt_sf).
  4. Regularización (04-regularizacion.md): Ridge estabiliza los coeficientes sin eliminar variables.
  5. Reducción de dimensionalidad (PCA, módulo 5): reemplaza los predictores originales por componentes no correlacionados. Es la más invasiva porque sacrifica interpretabilidad directa. Recordar el hallazgo del módulo 1 (ej02, parte C.4): PCA no ayuda cuando las variables ya están poco correlacionadas — solo tiene sentido aplicarlo cuando, como aquí, hay colinealidad real que comprimir.

5. Regresión polinómica

El modelo lineal asume que el efecto de cada predictor es una línea recta. Cuando la relación real es curva —el precio de una casa no sube al mismo ritmo por cada metro² adicional una vez que ya es muy grande—, se puede seguir usando el marco de regresión lineal agregando potencias del predictor:

y^=β0+β1x+β2x2+β3x3+\hat{y} = \beta_0 + \beta_1 x + \beta_2 x^2 + \beta_3 x^3 + \dots

Esto sigue siendo un modelo lineal en los parámetros β\boldsymbol{\beta} —la ecuación normal y el descenso del gradiente de las secciones anteriores se aplican sin cambios—, aunque ya no es lineal en xx. Lo mismo aplica a interacciones entre predictores (x1x2x_1 x_2): otra columna más para X\mathbf{X}.

El costo: multicolinealidad por construcción

xx y x2x^2 están, casi siempre, fuertemente correlacionadas en el rango típico de los datos —elevar al cuadrado no “des-correlaciona” nada—. Agregar términos polinómicos casi garantiza VIF altos entre esos términos, incluso si el predictor original no tenía colinealidad con nada más. Centrar xx antes de elevarlo al cuadrado (restar la media) reduce esa correlación, pero no la elimina.

Y un segundo costo, que se retoma en la sesión 8: un grado polinómico alto puede ajustar perfectamente los datos de entrenamiento y generalizar pésimo — la versión más directa de sobreajuste que existe en este curso. El grado del polinomio es, en sí mismo, un hiperparámetro que hay que elegir con validación, no con la vista.

Resumen

ConceptoIdeaDónde reaparece
VIFDetecta colinealidad multivariable, no solo paresSe calcula en el notebook 04 sobre Ames Housing
Predicción vs. interpretaciónLa multicolinealidad daña la segunda, no tanto la primeraGuía qué tan preocupante es cada caso
RegularizaciónEstabiliza β\boldsymbol{\beta} sin eliminar variables04-regularizacion.md, siguiente documento
Grado del polinomioHiperparámetro, no una elección visualSesgo-varianza y validación (sesión 8)
Comprueba

¿Lo tienes claro?

Autoevaluación · 2 preguntas 1 / 2

La autoevaluación completa del módulo reúne las preguntas de todas sus lecciones.

Fin de la lección

Cuando la tengas clara, márcala y sigue con Regularización: Ridge, Lasso y Elastic Net.