Módulo 1 · Sesiones 1–3 · 10.5 h

Fundamentos y ciclo de vida

5 lecciones 4 notebooks2 ejerciciosAutoevaluaciónQuiz
Ruta del módulo 0%
  1. 01 Qué es el Machine Learning S1
  2. 02 El ciclo de vida de un proyecto de Machine Learning S2
  3. 03 Versionado de código y datos: Git y DVC S2
  4. 04 Álgebra lineal para Machine Learning S3
  5. 05 Cálculo y probabilidad para Machine Learning S3
NotebooksÁbrelos en Colab sin instalar nada, o descárgalos para el entorno local.

Objetivos

Al finalizar el módulo, el estudiante será capaz de encuadrar un problema real como una tarea de Machine Learning, describir y aplicar el ciclo de vida de un proyecto de ML con control de versiones de código y datos, y manejar el andamiaje matemático (álgebra lineal, gradientes y probabilidad) sobre el que se construyen los algoritmos del curso.

Contenidos

✅ Núcleo

  • S1 — Definición y alcance del ML. IA vs. ML vs. DL. Tipos de aprendizaje: supervisado, no supervisado y por refuerzo. Taxonomía de problemas. Cuándo no usar ML.
  • S1 — Ecosistema Python y primer flujo fit/predict de punta a punta.
  • S2 — Las 7 etapas del ciclo de vida. Definición del problema: métricas de negocio vs. métricas técnicas. Estructura de un proyecto de ML.
  • S2 — Control de versiones con Git; versionado de datos con DVC.
  • S3 — Álgebra lineal con NumPy: vectores, matrices, producto punto, normas y distancias. Descomposiciones (eigen, SVD).
  • S3 — Cálculo: derivadas, gradientes y regla de la cadena. Probabilidad: distribuciones y teorema de Bayes.

🔵 Opcional

  • Historia y oleadas de la IA; panorama de aplicaciones por sector.
  • Flujos de trabajo con Git en equipo (ramas, pull requests) aplicados a proyectos de datos.
  • Pipelines de DVC para encadenar etapas reproducibles.

Materiales

Teoría

#DocumentoSesiónTema
01teoria/01-que-es-machine-learning.mdS1Definición operativa, IA/ML/DL, tipos de aprendizaje, encuadre de problemas, cuándo no usar ML
02teoria/02-ciclo-de-vida.mdS2Las 7 etapas, definición del problema, métricas de negocio vs. técnicas, dónde fracasan los proyectos
03teoria/03-versionado-codigo-datos.mdS2Git aplicado a datos, qué versionar, DVC
04teoria/04-algebra-lineal.mdS3Producto punto, normas, distancias, covarianza, vectores propios, SVD
05teoria/05-calculo-y-probabilidad.mdS3Gradientes, descenso, regla de la cadena, pérdidas, Bayes, máxima verosimilitud

Notebooks

#NotebookTipoContenido
01notebooks/01-primer-modelo-aplicado.ipynbaplicadoFlujo completo: encuadre, partición, fit/predict, métricas, referencia trivial, residuales
02notebooks/02-proyecto-reproducible-aplicado.ipynbaplicadoCiclo de vida, estructura de proyecto y los 4 niveles de reproducibilidad (semilla, entorno, datos, modelo)
03notebooks/03-algebra-lineal-intuicion.ipynbintuiciónNumPy desde cero: producto punto, normas, distancias, covarianza, eigen y SVD
04notebooks/04-gradientes-intuicion.ipynbintuiciónDerivadas, descenso 1D y 2D, tasa de aprendizaje, regla de la cadena, regresión sin scikit-learn

Datos

Dataset conductor del módulo: rendimiento-estudiantes.csv

ArchivoDescripciónVariables
datos/rendimiento-estudiantes.csv400 estudiantes ficticios de posgrado. Datos sintéticos con semilla fija: conocemos los coeficientes que los generaron, lo que permite verificar si el modelo los recuperaid_estudiante, programa (4 niveles), edad (21–48), estrato (1–6), trabaja (0/1), promedio_anterior (2.0–5.0), horas_estudio_semana, asistencia_pct (40–100), nota_final (0–5, objetivo de regresión), aprobo (0/1, objetivo de clasificación; 74 % positivos)
datos/generar-rendimiento-estudiantes.pyScript generador con SEMILLA = 42. Ejecutarlo reproduce el CSV byte a byte

Por qué datos simulados. Sin problemas de licencia ni privacidad, y con una ventaja pedagógica que ningún dataset real ofrece: como conocemos el proceso generador, podemos comparar lo que el modelo estima con la verdad. El módulo 2 pasa a datos reales, con toda su suciedad.

Ojo: aprobo se deriva de nota_final. Usar una para predecir la otra es fuga de datos, y el notebook 01 lo señala explícitamente.

Ejercicios

#EnunciadoSoluciónDuraciónTipo
01ejercicios/ej01-encuadre-problema.mdej01-encuadre-problema-sol.md45 minSin código
02ejercicios/ej02-algebra-gradientes.mdej02-algebra-gradientes-sol.md90 minCon código

El ejercicio 01 trabaja el encuadre de un caso de deserción estudiantil y la detección de fugas de datos (incluida una fuga por retroalimentación, difícil de ver). El 02 recorre álgebra lineal y descenso del gradiente con NumPy, y muestra empíricamente por qué hay que estandarizar.

Quiz

EnunciadoClavePreguntasDuración
quiz/quiz-modulo-1.mdquiz-modulo-1-sol.md1030 min

Entrega del proyecto integrador

E1 — Definición del problema. Encuadrar el caso como tarea de ML, definir la variable objetivo y las métricas de éxito (de negocio y técnicas), y montar el repositorio con Git y DVC. Ver ../proyecto-integrador/.


Los notebooks se ejecutan de principio a fin con el entorno de ../environment.yml. Reglas de estilo en ../docs/convenciones.md.