Objetivos
- Formular la regresión lineal simple y múltiple en notación matricial.
- Derivar la solución de mínimos cuadrados ordinarios (OLS) y entender qué está optimizando.
- Verificar los supuestos del modelo lineal mediante el análisis de residuales.
- Elegir e interpretar correctamente las métricas de error: MSE, RMSE, MAE, y ajustado.
1. De la regresión simple a la múltiple
En la regresión simple, una sola variable predice mediante una recta:
En la práctica casi ningún fenómeno depende de una sola variable. La regresión múltiple generaliza el modelo a predictores:
Escrito con la matriz de diseño (con una columna de unos para el intercepto) y el vector de parámetros :
Esta es la misma notación de 03-algebra-lineal-intuicion.ipynb (módulo 1): un producto
matriz-vector. Cada fila de es una observación; cada columna, una variable.
2. Mínimos cuadrados ordinarios (OLS)
“Ajustar” el modelo significa elegir que minimice el error cuadrático total. La función de costo de OLS es:
Es una función cuadrática y convexa en : tiene un único mínimo global, sin óptimos locales que confundan la búsqueda. Igualando el gradiente a cero se obtiene la ecuación normal, con solución cerrada:
Dos observaciones importantes, que reaparecen en las sesiones 6 y 7:
- La ecuación normal requiere invertir , una matriz . Si es grande, invertir es costoso (); el descenso del gradiente
(
02-descenso-gradiente.md) evita esa inversión. - Si las columnas de están muy correlacionadas entre sí (multicolinealidad, sesión 7), se vuelve casi singular y la inversión se desestabiliza: pequeños cambios en los datos producen coeficientes muy distintos.
¿Por qué el cuadrado y no el valor absoluto?
Porque produce una solución cerrada, diferenciable en todas partes, y penaliza los errores grandes más que proporcionalmente. Ese último punto es una elección de diseño, no una ley física: si los outliers no deben pesar tanto, se usa una pérdida más robusta (regresión robusta, sección opcional del módulo).
3. Los cinco supuestos del modelo lineal
OLS produce coeficientes válidos bajo ciertos supuestos. Verificarlos no es un trámite: si fallan, los coeficientes pueden seguir siendo el mejor ajuste lineal posible, pero los intervalos de confianza y las pruebas de hipótesis dejan de ser confiables.
| # | Supuesto | Qué significa | Cómo se verifica |
|---|---|---|---|
| 1 | Linealidad | La relación real entre e es (aproximadamente) lineal en los parámetros | Gráfico de residuales vs. valores ajustados: no debe haber patrón curvo |
| 2 | Independencia | Los errores no están correlacionados entre sí | Gráfico de residuales en el orden de recolección; en series de tiempo, Durbin-Watson |
| 3 | Homocedasticidad | La varianza del error es constante para todos los niveles de | Residuales vs. ajustados: la dispersión no debe ensancharse (“forma de embudo”) |
| 4 | Normalidad de residuales | Histograma o gráfico Q-Q de los residuales | |
| 5 | Sin multicolinealidad severa | Los predictores no son combinaciones casi lineales entre sí | VIF (sesión 7) |
El supuesto que más se ignora en la práctica es la homocedasticidad, y es también el más fácil de ver: si el gráfico de residuales contra valores ajustados tiene forma de embudo (el error crece con el precio, por ejemplo), significa que el modelo es peor prediciendo los valores altos que los bajos — algo que el global no revela.
Residuales: la principal herramienta de diagnóstico
El residual de la observación es . Un buen ajuste produce residuales que se ven como ruido puro, sin estructura, cuando se grafican contra los valores ajustados o contra cada predictor. Si aparece un patrón (una curva, un embudo, una tendencia), el patrón es información que el modelo no capturó.
4. Métricas de error
Todas se calculan sobre los residuales, pero comunican cosas distintas.
Error cuadrático medio (MSE):
Es la misma cantidad que minimiza OLS (salvo la constante ). Penaliza fuerte los errores grandes, pero sus unidades son las de al cuadrado — difícil de interpretar directamente.
Raíz del error cuadrático medio (RMSE): . Recupera las unidades originales de : “en promedio, el modelo se equivoca por RMSE unidades”, con más peso a los errores grandes que el MAE.
Error absoluto medio (MAE):
También está en las unidades de , pero trata todos los errores proporcionalmente a su tamaño, sin el peso extra a los grandes que tiene el RMSE. Si , hay algunos errores grandes (outliers de predicción) que están dominando el RMSE.
Coeficiente de determinación ():
Compara el modelo contra la referencia trivial de predecir siempre (la misma
referencia trivial del notebook 01-primer-modelo-aplicado.ipynb del módulo 1). es
ajuste perfecto; significa que el modelo no mejora sobre predecir el promedio;
es posible en test y significa que el modelo es peor que esa referencia trivial.
ajustado. El ordinario nunca puede bajar al agregar variables, aunque sean ruido puro — mecánicamente, más columnas en nunca aumentan . Eso lo hace inútil para comparar modelos con distinto número de predictores. El ajustado penaliza por cada variable agregada:
Si una variable nueva no aporta señal real, el ajustado baja aunque el ordinario suba (ligerísimamente). Es la primera defensa, muy barata, contra el sobreajuste por exceso de variables — el tema completo de la sesión 8.
Resumen
| Concepto | Para qué sirve | Dónde reaparece |
|---|---|---|
| Ecuación normal | Solución exacta de OLS | Comparación contra el descenso del gradiente (sesión 6, notebook 01) |
| Residuales | Diagnóstico visual de los 5 supuestos | Regularización (sesión 7), sesgo-varianza (sesión 8) |
| ajustado | Penaliza variables sin señal | Selección de modelos (sesión 8) |
| Multicolinealidad (supuesto 5) | Inestabilidad de | VIF y regularización (sesión 7) |