Módulo 3 · Sesiones 6–8 · 10.5 h

Supervisado I: regresión y evaluación

6 lecciones 6 notebooks3 ejerciciosAutoevaluaciónQuiz
Ruta del módulo 0%
  1. 01 Regresión lineal: formulación, ajuste y diagnóstico S6
  2. 02 Descenso del gradiente aplicado a regresión múltiple S6
  3. 03 Multicolinealidad, VIF y regresión polinómica S7
  4. 04 Regularización: Ridge, Lasso y Elastic Net S7
  5. 05 Sesgo-varianza, validación cruzada y comparación honesta de modelos S8
  6. 06 Búsqueda de hiperparámetros y validación cruzada anidada S8
NotebooksÁbrelos en Colab sin instalar nada, o descárgalos para el entorno local.
  • 01

    Descenso del gradiente para regresión múltiple, desde cero

    intuición

    Extiende el descenso a gradiente manual del módulo 1 a regresión múltiple vectorizada; batch/mini-batch/SGD; divergencia sin escalar

  • 02

    Regresión múltiple aplicada: Ames Housing

    aplicado

    Pipeline sobre Ames Housing; métricas; residuales en embudo; RMSE vs. MAE al modelar en log(precio)

  • 03

    Ridge y Lasso desde cero: por qué encogen distinto

    intuición

    Ridge y Lasso a mano (descenso con penalización L2; descenso por coordenadas para L1); inestabilidad de OLS por colinealidad, medida con bootstrap

  • 04

    VIF, regresión polinómica y regularización sobre Ames Housing

    aplicado

    VIF sobre Ames Housing, términos polinómicos y su costo en colinealidad, Ridge/Lasso con scikit-learn

  • 05

    Sesgo-varianza con función verdadera conocida

    intuición

    Regresión polinómica sobre función verdadera conocida; k-fold a mano con barras de error; por qué barras solapadas no son una comparación pareada; curvas de aprendizaje

  • 06

    Grid, random, Optuna, CV anidada y comparación honesta — Ames Housing

    aplicado

    Grid/random/Optuna sobre Ames Housing, CV anidada, comparación pareada Ridge vs. Lasso con y sin fuga de selección, y el RMSE final sobre el conjunto de prueba

Visualizadores Interactivos del módulo; cada uno vive dentro de su lección.

Estado: completo (Fase 3 de ../PLAN.md).

Objetivos

Al finalizar el módulo, el estudiante será capaz de formular, ajustar y diagnosticar modelos de regresión —incluyendo su optimización por descenso del gradiente y su regularización— y de evaluar cualquier modelo de forma honesta mediante validación cruzada y búsqueda sistemática de hiperparámetros.

Contenidos

✅ Núcleo

  • S6 — Regresión lineal simple y múltiple. Mínimos cuadrados ordinarios.
  • S6 — Descenso del gradiente: función de costo, tasa de aprendizaje, convergencia.
  • S6 — Supuestos del modelo lineal y análisis de residuales. Métricas: MSE, RMSE, MAE, R2R^2 y R2R^2 ajustado.
  • S7 — Multicolinealidad: diagnóstico con matriz de correlación y VIF.
  • S7 — Regresión polinómica. Regularización Ridge (L2L_2), Lasso (L1L_1) y Elastic Net.
  • S8 — Compromiso sesgo-varianza. Sobreajuste y subajuste.
  • S8 — Validación cruzada: k-fold, estratificada y temporal. Curvas de aprendizaje y de validación.
  • S8 — Búsqueda de hiperparámetros: grid, aleatoria y bayesiana (Optuna). Reproducibilidad y semillas.

🔵 Opcional

  • Regresión robusta y tratamiento de outliers influyentes.
  • Comparación scikit-learn vs. statsmodels: predicción vs. inferencia.
  • Métricas alternativas: MAPE, error cuadrático logarítmico.

Materiales

Teoría

#DocumentoSesiónTema
01teoria/01-regresion-lineal.mdS6Formulación, OLS, supuestos, residuales, métricas
02teoria/02-descenso-gradiente.mdS6Función de costo, gradiente, tasa de aprendizaje, variantes
03teoria/03-multicolinealidad-polinomica.mdS7VIF, diagnóstico, regresión polinómica
04teoria/04-regularizacion.mdS7Ridge, Lasso, Elastic Net; geometría e interpretación
05teoria/05-sesgo-varianza-validacion.mdS8Descomposición del error, k-fold repetido, comparación pareada
06teoria/06-seleccion-hiperparametros.mdS8Grid, random, optimización bayesiana; CV anidada

Notebooks

#NotebookTipoContenido
01notebooks/01-descenso-gradiente-intuicion.ipynbintuiciónExtiende el descenso a gradiente manual del módulo 1 a regresión múltiple vectorizada; batch/mini-batch/SGD; divergencia sin escalar
02notebooks/02-regresion-multiple-aplicado.ipynbaplicadoPipeline sobre Ames Housing; métricas; residuales en embudo; RMSE vs. MAE al modelar en log(precio)
03notebooks/03-regularizacion-intuicion.ipynbintuiciónRidge y Lasso a mano (descenso con penalización L2L_2; descenso por coordenadas para L1L_1); inestabilidad de OLS por colinealidad, medida con bootstrap
04notebooks/04-regularizacion-aplicado.ipynbaplicadoVIF sobre Ames Housing, términos polinómicos y su costo en colinealidad, Ridge/Lasso con scikit-learn
05notebooks/05-sesgo-varianza-intuicion.ipynbintuiciónRegresión polinómica sobre función verdadera conocida; k-fold a mano con barras de error; por qué barras solapadas no son una comparación pareada; curvas de aprendizaje
06notebooks/06-seleccion-modelos-aplicado.ipynbaplicadoGrid/random/Optuna sobre Ames Housing, CV anidada, comparación pareada Ridge vs. Lasso con y sin fuga de selección, y el RMSE final sobre el conjunto de prueba

Hallazgo del notebook 02. Modelar log(1+precio)\log(1+\text{precio}) en vez del precio directo baja el MAE y el MAPE en los cuatro cuartiles de precio, pero sube el RMSE: una sola vivienda atípica (grande, de calidad máxima, vendida muy por debajo de lo esperado) produce un error de más de 700 mil dólares al revertir la transformación logarítmica. RMSE y MAE discrepan sobre cuál modelo es mejor — la métrica que se elige es una decisión, no un trámite.

Hallazgo del notebook 04. Agregar gr_liv_area² y overall_qual² dispara el VIF de esas variables a ≈ 50 y produce coeficientes gigantes de signo opuesto — pero el RMSE de validación no mejora con más regularización: con n=2930n=2930 frente a p24p\approx 24, la multicolinealidad aquí daña la interpretación, no la predicción, tal como anticipa 03-multicolinealidad-polinomica.md. Ridge y Lasso sí estabilizan el par colineal, a ritmos muy distintos entre sí.

Hallazgo del notebook 06. Comparando Ridge y Lasso —cada uno afinado por CV— sobre los mismos 10 pliegues, la conclusión depende de cómo se haya elegido λ\lambda. Si se elige una sola vez con todo el entrenamiento y después se evalúa sobre pliegues de ese mismo entrenamiento —la fuga que el propio notebook mide en la sección 4—, la diferencia es −$10 con un error estándar de $35: “no hay diferencia detectable”. Si cada pliegue elige su λ\lambda con datos que no lo incluyen, la diferencia es −$41 con ee $17, apenas por encima de la regla de dos errores estándar. La higiene metodológica no solo corrige un número: aquí cambia la respuesta. Y aun así, $41 sobre un RMSE de $33,460 es un 0.12 % — detectable no es lo mismo que relevante.

Datos

Dataset conductor del módulo: ames-housing.csv

ArchivoDescripciónPor qué este
datos/ames-housing.csv2930 viviendas vendidas en Ames, Iowa (2006–2010), 80 variables tras limpiar columnas identificadoras. Dominio público (De Cock, 2011), vía wblakecannon/amesDataset real de tamaño moderado, con variables numéricas y categóricas, ideal para regresión múltiple, regularización y selección de modelos
datos/preparar-ames-housing.pyDescarga desde la fuente y normaliza encabezados a snake_caseDocumenta la procedencia exacta; idempotente
datos/rendimiento-estudiantes.csvMismo dataset sintético del módulo 1 (400 estudiantes)El notebook 01 extiende exactamente el ajuste por descenso del gradiente que el módulo 1 hizo con una sola variable, ahora con seis
datos/generar-rendimiento-estudiantes.pyGenerador con semilla fija (copiado del módulo 1)Reproducible byte a byte

Ejercicios

#EnunciadoSoluciónDuración
01ejercicios/ej01-residuales.mdej01-residuales-sol.md75 min
02ejercicios/ej02-regularizacion.mdej02-regularizacion-sol.md75 min
03ejercicios/ej03-validacion-cruzada.mdej03-validacion-cruzada-sol.md75 min

Los tres ejercicios comparten un mismo subconjunto de variables de Ames Housing —distinto al de los notebooks— y se encadenan: el 01 descubre que full_bath/half_bath tienen coeficientes de signo contraintuitivo a pesar de un VIF bajo; el 02 mide ese VIF, prueba Ridge/Lasso/Elastic Net y muestra que corregir el signo exige mucho más λ\lambda del que conviene para predecir; el 03 cierra con CV formal y una comparación pareada que encuentra una diferencia que además importa: foundation aporta $961 de RMSE con un ee de $211 (cociente 4.6), frente a los $41 apenas detectables —y prácticamente irrelevantes— que el notebook 06 mide entre Ridge y Lasso.

Quiz

ArchivoClavePreguntasDuración
quiz/quiz-modulo-3.mdquiz-modulo-3-sol.md1030 min

Entrega del proyecto integrador

E3 — Línea base. Primer modelo del caso con validación cruzada honesta y métricas justificadas, que servirá de referencia para todo lo que venga después. Ver ../proyecto-integrador/.


Los notebooks se ejecutan de principio a fin con el entorno de ../environment.yml. Reglas de estilo en ../docs/convenciones.md.