Módulo 3 · Sesión 6

01 Regresión lineal: formulación, ajuste y diagnóstico

Regresión Regresión lineal

Objetivos

  • Formular la regresión lineal simple y múltiple en notación matricial.
  • Derivar la solución de mínimos cuadrados ordinarios (OLS) y entender qué está optimizando.
  • Verificar los supuestos del modelo lineal mediante el análisis de residuales.
  • Elegir e interpretar correctamente las métricas de error: MSE, RMSE, MAE, R2R^2 y R2R^2 ajustado.

1. De la regresión simple a la múltiple

En la regresión simple, una sola variable xx predice yy mediante una recta:

y^=β0+β1x\hat{y} = \beta_0 + \beta_1 x

En la práctica casi ningún fenómeno depende de una sola variable. La regresión múltiple generaliza el modelo a pp predictores:

y^=β0+β1x1+β2x2++βpxp\hat{y} = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \dots + \beta_p x_p

Escrito con la matriz de diseño XRn×(p+1)\mathbf{X} \in \mathbb{R}^{n \times (p+1)} (con una columna de unos para el intercepto) y el vector de parámetros βRp+1\boldsymbol{\beta} \in \mathbb{R}^{p+1}:

y^=Xβ\hat{\mathbf{y}} = \mathbf{X}\boldsymbol{\beta}

Esta es la misma notación de 03-algebra-lineal-intuicion.ipynb (módulo 1): un producto matriz-vector. Cada fila de X\mathbf{X} es una observación; cada columna, una variable.

2. Mínimos cuadrados ordinarios (OLS)

“Ajustar” el modelo significa elegir β\boldsymbol{\beta} que minimice el error cuadrático total. La función de costo de OLS es:

L(β)=i=1n(yiy^i)2=yXβ22\mathcal{L}(\boldsymbol{\beta}) = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 = \lVert \mathbf{y} - \mathbf{X}\boldsymbol{\beta} \rVert_2^2

Es una función cuadrática y convexa en β\boldsymbol{\beta}: tiene un único mínimo global, sin óptimos locales que confundan la búsqueda. Igualando el gradiente a cero se obtiene la ecuación normal, con solución cerrada:

β=(XX)1Xy\boldsymbol{\beta} = (\mathbf{X}^{\top}\mathbf{X})^{-1}\mathbf{X}^{\top}\mathbf{y}

Dos observaciones importantes, que reaparecen en las sesiones 6 y 7:

  • La ecuación normal requiere invertir XX\mathbf{X}^{\top}\mathbf{X}, una matriz (p+1)×(p+1)(p+1)\times (p+1). Si pp es grande, invertir es costoso (O(p3)O(p^3)); el descenso del gradiente (02-descenso-gradiente.md) evita esa inversión.
  • Si las columnas de X\mathbf{X} están muy correlacionadas entre sí (multicolinealidad, sesión 7), XX\mathbf{X}^{\top}\mathbf{X} se vuelve casi singular y la inversión se desestabiliza: pequeños cambios en los datos producen coeficientes muy distintos.

¿Por qué el cuadrado y no el valor absoluto?

Porque produce una solución cerrada, diferenciable en todas partes, y penaliza los errores grandes más que proporcionalmente. Ese último punto es una elección de diseño, no una ley física: si los outliers no deben pesar tanto, se usa una pérdida más robusta (regresión robusta, sección opcional del módulo).

3. Los cinco supuestos del modelo lineal

OLS produce coeficientes válidos bajo ciertos supuestos. Verificarlos no es un trámite: si fallan, los coeficientes pueden seguir siendo el mejor ajuste lineal posible, pero los intervalos de confianza y las pruebas de hipótesis dejan de ser confiables.

#SupuestoQué significaCómo se verifica
1LinealidadLa relación real entre X\mathbf{X} e yy es (aproximadamente) lineal en los parámetrosGráfico de residuales vs. valores ajustados: no debe haber patrón curvo
2IndependenciaLos errores εi\varepsilon_i no están correlacionados entre síGráfico de residuales en el orden de recolección; en series de tiempo, Durbin-Watson
3HomocedasticidadLa varianza del error es constante para todos los niveles de y^\hat{y}Residuales vs. ajustados: la dispersión no debe ensancharse (“forma de embudo”)
4Normalidad de residualesεiN(0,σ2)\varepsilon_i \sim \mathcal{N}(0, \sigma^2)Histograma o gráfico Q-Q de los residuales
5Sin multicolinealidad severaLos predictores no son combinaciones casi lineales entre síVIF (sesión 7)

El supuesto que más se ignora en la práctica es la homocedasticidad, y es también el más fácil de ver: si el gráfico de residuales contra valores ajustados tiene forma de embudo (el error crece con el precio, por ejemplo), significa que el modelo es peor prediciendo los valores altos que los bajos — algo que el R2R^2 global no revela.

Residuales: la principal herramienta de diagnóstico

El residual de la observación ii es ei=yiy^ie_i = y_i - \hat{y}_i. Un buen ajuste produce residuales que se ven como ruido puro, sin estructura, cuando se grafican contra los valores ajustados o contra cada predictor. Si aparece un patrón (una curva, un embudo, una tendencia), el patrón es información que el modelo no capturó.

4. Métricas de error

Todas se calculan sobre los residuales, pero comunican cosas distintas.

Error cuadrático medio (MSE):

MSE=1ni=1n(yiy^i)2\text{MSE} = \frac{1}{n}\sum_{i=1}^{n} (y_i - \hat{y}_i)^2

Es la misma cantidad que minimiza OLS (salvo la constante nn). Penaliza fuerte los errores grandes, pero sus unidades son las de yy al cuadrado — difícil de interpretar directamente.

Raíz del error cuadrático medio (RMSE): RMSE=MSE\text{RMSE} = \sqrt{\text{MSE}}. Recupera las unidades originales de yy: “en promedio, el modelo se equivoca por RMSE unidades”, con más peso a los errores grandes que el MAE.

Error absoluto medio (MAE):

MAE=1ni=1nyiy^i\text{MAE} = \frac{1}{n}\sum_{i=1}^{n} |y_i - \hat{y}_i|

También está en las unidades de yy, pero trata todos los errores proporcionalmente a su tamaño, sin el peso extra a los grandes que tiene el RMSE. Si RMSEMAE\text{RMSE} \gg \text{MAE}, hay algunos errores grandes (outliers de predicción) que están dominando el RMSE.

Coeficiente de determinación (R2R^2):

R2=1i(yiy^i)2i(yiyˉ)2=1SSresSStotR^2 = 1 - \frac{\sum_i (y_i - \hat{y}_i)^2}{\sum_i (y_i - \bar{y})^2} = 1 - \frac{\text{SS}_{\text{res}}}{\text{SS}_{\text{tot}}}

Compara el modelo contra la referencia trivial de predecir siempre yˉ\bar{y} (la misma referencia trivial del notebook 01-primer-modelo-aplicado.ipynb del módulo 1). R2=1R^2=1 es ajuste perfecto; R2=0R^2=0 significa que el modelo no mejora sobre predecir el promedio; R2<0R^2<0 es posible en test y significa que el modelo es peor que esa referencia trivial.

R2R^2 ajustado. El R2R^2 ordinario nunca puede bajar al agregar variables, aunque sean ruido puro — mecánicamente, más columnas en X\mathbf{X} nunca aumentan SSres\text{SS}_{\text{res}}. Eso lo hace inútil para comparar modelos con distinto número de predictores. El R2R^2 ajustado penaliza por cada variable agregada:

Rajustado2=1(1R2)n1np1R^2_{\text{ajustado}} = 1 - (1 - R^2)\frac{n - 1}{n - p - 1}

Si una variable nueva no aporta señal real, el R2R^2 ajustado baja aunque el R2R^2 ordinario suba (ligerísimamente). Es la primera defensa, muy barata, contra el sobreajuste por exceso de variables — el tema completo de la sesión 8.

Resumen

ConceptoPara qué sirveDónde reaparece
Ecuación normalSolución exacta de OLSComparación contra el descenso del gradiente (sesión 6, notebook 01)
ResidualesDiagnóstico visual de los 5 supuestosRegularización (sesión 7), sesgo-varianza (sesión 8)
R2R^2 ajustadoPenaliza variables sin señalSelección de modelos (sesión 8)
Multicolinealidad (supuesto 5)Inestabilidad de β\boldsymbol{\beta}VIF y regularización (sesión 7)
Comprueba

¿Lo tienes claro?

Autoevaluación · 2 preguntas 1 / 2

La autoevaluación completa del módulo reúne las preguntas de todas sus lecciones.

Fin de la lección

Cuando la tengas clara, márcala y sigue con Descenso del gradiente aplicado a regresión múltiple.