Cerramos el módulo introductorio con la lección más práctica de todas: el ciclo de vida completo de un proyecto de Machine Learning. Un modelo no aparece por arte de magia; es el resultado de un proceso con fases bien definidas, desde la definición del problema de negocio hasta el monitoreo del modelo en producción. Esta lección tiene una doble función: te da el proceso profesional estándar, y además funciona como mapa del curso, porque cada fase del flujo se corresponde con uno o varios módulos que estudiaremos en detalle. Para que nada quede abstracto, recorreremos el flujo de principio a fin con un ejemplo guiado: el problema de churn (abandono de clientes) de MercaFresh, a alto nivel y sin código complejo.
Contenido
- Visión general: el flujo y su naturaleza iterativa
- Fase 1: Definición del problema
- Fase 2: Obtención de los datos
- Fase 3: Exploración de los datos
- Fase 4: Preprocesamiento
- Fase 5: Entrenamiento del modelo
- Fase 6: Evaluación
- Fase 7: Despliegue y monitoreo
- El flujo como mapa del curso
- Ejemplo guiado: el churn de MercaFresh de principio a fin
Visión general: el flujo y su naturaleza iterativa
El flujo estándar tiene siete fases. Lo primero que debes saber es que no es una línea recta, sino un ciclo con retornos: es normal descubrir en la evaluación que faltan datos, o en la exploración que el problema estaba mal definido, y volver atrás. Los proyectos reales dan varias vueltas antes de llegar a producción.
flowchart TD
A[1. Definición del problema] --> B[2. Obtención de datos]
B --> C[3. Exploración de datos]
C --> D[4. Preprocesamiento]
D --> E[5. Entrenamiento del modelo]
E --> F[6. Evaluación]
F -->|Resultados suficientes| G[7. Despliegue y monitoreo]
F -->|Resultados insuficientes| D
F -.->|Faltan datos o señal| B
C -.->|El problema estaba mal planteado| A
G -.->|El rendimiento se degrada con el tiempo| B
Una regla de oro que sorprende a los principiantes: en un proyecto típico, la mayor parte del tiempo (a menudo el 60-80 %) se va en las fases 2-4 (datos), no en entrenar modelos. El entrenamiento es la fase más glamurosa y, casi siempre, la más corta.
Fase 1: Definición del problema
Todo empieza en el negocio, no en los datos. En esta fase se responde:
- ¿Qué decisión queremos mejorar? ("A qué clientes dirigir la campaña de retención").
- ¿Qué tipo de problema de ML es? Aplicando la guía de la lección 01-03: ¿regresión, clasificación, clustering...?
- ¿Cuál será la métrica de éxito? Tanto la técnica (porcentaje de acierto) como la de negocio (reducir las bajas un 15 %). Es la P de la definición de Mitchell (lección 01-01).
- ¿Cuál es el baseline? La solución simple actual que el modelo deberá superar (lección 01-04).
- ¿Es viable y compensa? Las 6 condiciones que estudiamos en la lección anterior.
Un enunciado bien definido tiene esta forma: "Predecir [qué] para [quién/cuándo] usando [qué datos], midiendo el éxito con [métrica], para mejorar [decisión de negocio]".
Fase 2: Obtención de los datos
Localizar, extraer y juntar los datos relevantes:
- Fuentes internas: base de datos de pedidos, CRM de clientes, logs de la web.
- Fuentes externas: calendario de festivos, meteorología, datos demográficos públicos.
- Construcción de la etiqueta (en problemas supervisados): definir operativamente qué es un "positivo". Parece trivial y no lo es: ¿qué es exactamente un cliente que "abandona" un supermercado online, si nadie se "da de baja"? Habrá que definirlo (p. ej., "90 días sin comprar").
Los aspectos prácticos de manejar estos datos con pandas aparecerán transversalmente desde el módulo 3.
Fase 3: Exploración de los datos
Conocida como EDA (Exploratory Data Analysis): mirar los datos antes de tocarlos.
- Estadísticas descriptivas: medias, medianas, rangos, distribuciones (todo esto es el módulo 2).
- Visualizaciones: histogramas, diagramas de dispersión, series temporales.
- Relaciones entre variables: correlaciones (lección 02-03).
- Sorpresas: valores imposibles (edades de 200 años), duplicados, huecos, desequilibrios (¿solo el 4 % de los clientes abandona?).
La exploración frecuentemente reescribe el proyecto: aquí se descubre que la variable clave no se registra desde 2024, o que el 30 % de los clientes no tiene código postal informado.
Fase 4: Preprocesamiento
Los datos crudos casi nunca sirven tal cual. Hay que:
- Limpiar: corregir errores, eliminar duplicados (03-01).
- Tratar valores faltantes: eliminar o imputar (03-02).
- Transformar y codificar: convertir categorías como "ciudad" a números que el algoritmo entienda (03-03, 03-04).
- Escalar: normalizar o estandarizar magnitudes (03-05).
- Crear características nuevas con conocimiento del negocio (feature engineering, 03-06): por ejemplo, "días desde la última compra" no existe en la base de datos, se calcula, y suele ser la variable más predictiva del churn.
A todo el módulo 3 le dedicaremos este trabajo, porque es donde se gana o se pierde la calidad del modelo.
Fase 5: Entrenamiento del modelo
Por fin, la fase "estrella" (y la más corta):
- Elegir uno o varios algoritmos candidatos acordes al tipo de problema (los del módulo 4 si es supervisado, los del módulo 5 si es no supervisado).
- Entrenarlos con los datos preparados (el
fit()que ya conoces de la lección 01-01). - Ajustar su configuración (los hiperparámetros, que optimizaremos en el módulo 7).
En la práctica profesional se prueban varios algoritmos y se comparan; rara vez se sabe de antemano cuál funcionará mejor en tus datos.
Fase 6: Evaluación
¿El modelo es bueno de verdad? Responderlo con rigor es todo el módulo 6:
- Separar datos de entrenamiento y de prueba, para medir sobre ejemplos que el modelo no vio (06-01): la capacidad de generalizar que mencionamos en la lección 01-01.
- Calcular métricas adecuadas al problema (06-02, 06-04): con solo un 4 % de clientes que abandonan, un modelo inútil que siempre diga "se queda" acierta el 96 %; por eso elegir bien la métrica es crítico.
- Detectar overfitting/underfitting (06-05): memorizar el pasado no es aprender.
- Comparar contra el baseline y contra la métrica de negocio definida en la fase 1. Si no lo supera, se vuelve a la fase 4 (o a la 2): el ciclo del diagrama.
Fase 7: Despliegue y monitoreo
Un modelo que vive en el portátil del analista no genera valor. Hay que:
- Desplegarlo: integrarlo en los sistemas reales (una API que el CRM consulta, un proceso nocturno que puntúa a todos los clientes) — módulo 8 (08-01, 08-02).
- Monitorizarlo: el mundo cambia (nuevos hábitos, nuevos productos, una pandemia...) y el rendimiento de los modelos se degrada con el tiempo (fenómeno conocido como drift). Hay que vigilar métricas y reentrenar periódicamente (08-03).
- Gobernarlo: ética, privacidad y cumplimiento normativo (08-04).
Por eso la última flecha del diagrama vuelve al principio: un proyecto de ML no "termina"; se mantiene.
El flujo como mapa del curso
Esta tabla es tu mapa de navegación para todo el curso: cada fase del flujo indica dónde se estudia en profundidad.
| Fase del flujo | Qué se hace | Dónde se estudia en este curso |
|---|---|---|
| 1. Definición del problema | Objetivo, tipo de problema, métrica, baseline, viabilidad | Módulo 1 (lecciones 01-03 y 01-04) |
| 2. Obtención de datos | Fuentes, extracción, construcción de la etiqueta | Transversal (módulos 3 y 9) |
| 3. Exploración (EDA) | Estadísticas, distribuciones, correlaciones | Módulo 2 |
| 4. Preprocesamiento | Limpieza, faltantes, codificación, escalado, features | Módulo 3 |
| 5. Entrenamiento | Algoritmos supervisados / no supervisados | Módulos 4 y 5 |
| 6. Evaluación | División de datos, métricas, validación, over/underfitting | Módulo 6 |
| (Mejora iterativa) | Regularización, ensembles, hiperparámetros | Módulo 7 |
| 7. Despliegue y monitoreo | Producción, mantenimiento, ética | Módulo 8 |
| Todo el ciclo, integrado | Proyectos completos de principio a fin | Módulo 9 |
Ejemplo guiado: el churn de MercaFresh de principio a fin
Recorramos ahora el ciclo completo con el problema que nos acompañará en varios módulos. Todo a alto nivel: los detalles técnicos llegarán en sus módulos.
Fase 1 — Definición. Dirección constata que captar un cliente nuevo cuesta unas 5 veces más que retener uno existente. Enunciado del proyecto: "Predecir qué clientes activos dejarán de comprar en los próximos 90 días, usando su historial de pedidos y navegación, midiendo el éxito por la proporción de abandonos correctamente anticipados, para dirigirles una campaña de retención con cupones". Es un problema supervisado de clasificación binaria (lección 01-03). Baseline actual: el equipo de marketing envía cupones a quien no compra desde hace 60 días, sin más criterio.
Fase 2 — Obtención. Se extraen del sistema de pedidos 24 meses de historial y del CRM los datos de cada cliente. Decisión clave: se define "abandono" como 90 días consecutivos sin ningún pedido. Con esa definición se construye la etiqueta: para cada cliente, mirando una fecha de corte pasada, sabemos si en los 90 días siguientes abandonó (1) o no (0).
Fase 3 — Exploración. Primeros hallazgos: solo el 7 % de los clientes abandona por trimestre (clases muy desequilibradas, lo que condicionará la métrica en la fase 6); hay clientes duplicados por registrarse con dos correos; y la frecuencia de compra cae de forma visible semanas antes del abandono — buena noticia: hay señal que aprender.
Fase 4 — Preprocesamiento. Se eliminan duplicados, se imputan códigos postales faltantes, se codifica la ciudad como variable numérica y se crean características con conocimiento de negocio: dias_desde_ultima_compra, pedidos_ultimo_trimestre, variacion_ticket_medio, incidencias_de_entrega_recientes.
Fase 5 — Entrenamiento. Se entrenan dos o tres clasificadores candidatos del módulo 4 (por ejemplo, regresión logística y árboles de decisión) con los datos preparados. Conceptualmente, la escena es la que ya conoces:
# El corazón del proyecto, conceptualmente (los detalles, en los módulos 3-6)
modelo.fit(X_entrenamiento, y_entrenamiento) # aprende de clientes del pasado
probabilidades = modelo.predict(X_clientes_hoy) # puntúa a los clientes actualesDos líneas que resumen semanas de trabajo: X_entrenamiento es el resultado de las fases 2-4 (clientes históricos descritos por sus características), y_entrenamiento es la etiqueta construida en la fase 2, y la predicción asigna a cada cliente actual su riesgo de abandono.
Fase 6 — Evaluación. Se mide sobre clientes que el modelo no vio en el entrenamiento. Dado el desequilibrio (7 %), el porcentaje bruto de aciertos engaña, así que se usan métricas adecuadas al problema (las de 06-02 y 06-04). El modelo detecta al 71 % de los futuros abandonos frente al ~35 % que capturaba la regla de los 60 días: supera el baseline con claridad.
Fase 7 — Despliegue y monitoreo. Cada lunes, un proceso automático puntúa a todos los clientes activos y envía al CRM la lista de alto riesgo; marketing les dirige la campaña de retención. Se monitorizan dos cosas: la calidad de las predicciones (¿sigue acertando?) y el resultado de negocio (¿bajan las bajas?). Seis meses después, un cambio en la app móvil altera los patrones de navegación y el rendimiento cae: se reentrena con datos recientes. El ciclo continúa.
Errores Comunes y Consejos
- Empezar por el modelo y no por el problema. Entrenar sin una métrica de éxito y un baseline definidos es andar sin brújula; las fases 1-3 no son burocracia, son el proyecto.
- Subestimar el trabajo de datos. Reserva en tu planificación (mental y real) la mayor parte del esfuerzo para las fases 2-4; es lo que encontrarás en cualquier equipo profesional.
- Tratar el flujo como una cascada rígida. Volver atrás no es fracasar: es el funcionamiento normal del ciclo. Presupuesta iteraciones.
- Evaluar con los mismos datos del entrenamiento. Es el error técnico número uno de los principiantes: da resultados espectaculares e inútiles. El módulo 6 te enseñará a evitarlo sistemáticamente.
- Olvidar el monitoreo. Un modelo desplegado y abandonado se degrada en silencio. Si nadie lo vigila, nadie sabrá cuándo dejó de funcionar.
- Consejo: guarda la tabla "flujo → módulos" de esta lección y vuelve a ella al empezar cada módulo del curso: sabrás siempre en qué fase del proyecto estás trabajando y por qué importa.
Ejercicios
Ejercicio 1
Ordena estas actividades del proyecto de churn según la fase del flujo a la que pertenecen (1-7): (a) descubrir que el 7 % de los clientes abandona por trimestre; (b) crear la variable dias_desde_ultima_compra; (c) acordar con marketing que el éxito se medirá por la proporción de abandonos anticipados; (d) reentrenar el modelo porque su rendimiento cayó tras el cambio de la app; (e) definir "abandono" como 90 días sin comprar y construir la etiqueta; (f) comparar el modelo contra la regla de los 60 días.
Ejercicio 2
Escribe el enunciado completo de proyecto (con la plantilla "Predecir [qué] para [quién/cuándo] usando [qué datos], midiendo con [métrica], para mejorar [decisión]") para el problema de previsión de demanda de frescos de MercaFresh presentado en la lección 01-04. Indica además qué tipo de problema es y propón un baseline razonable.
Ejercicio 3
En el ejemplo guiado, la exploración reveló que solo el 7 % de los clientes abandona. Explica en 3-4 líneas por qué un modelo que siempre predice "se queda" acertaría el 93 % de las veces y, sin embargo, sería completamente inútil para MercaFresh. ¿Qué fase del flujo se encarga de evitar este espejismo y en qué módulo se estudia?
Soluciones
Solución 1
- (c) → Fase 1 (definición del problema: métrica de éxito).
- (e) → Fase 2 (obtención de datos: construcción de la etiqueta).
- (a) → Fase 3 (exploración: descubrir el desequilibrio de clases).
- (b) → Fase 4 (preprocesamiento: ingeniería de características).
- (f) → Fase 6 (evaluación: comparación contra el baseline).
- (d) → Fase 7 (monitoreo y mantenimiento: reentrenar ante la degradación).
Solución 2
Enunciado posible: "Predecir las unidades que se venderán de cada producto fresco, para cada día de la próxima semana, usando el historial de ventas, el calendario de festivos, las promociones activas y la previsión meteorológica, midiendo el éxito con el error medio entre unidades previstas y vendidas, para mejorar las órdenes de compra a proveedores y reducir la merma y las roturas de stock". Es un problema supervisado de regresión (la etiqueta es un número: unidades vendidas). Baseline razonable: la regla actual del responsable de compras — la media de ventas de las últimas 4 semanas más un 10 % de margen.
Solución 3
Como el 93 % de los clientes no abandona, un modelo que responda siempre "se queda" coincide con la realidad el 93 % de las veces sin haber aprendido nada: no identifica a ninguno de los clientes en riesgo, que son precisamente los que interesan para la campaña de retención. El acierto bruto es un espejismo en clases desequilibradas. Lo evita la fase 6 (evaluación), eligiendo métricas adecuadas al problema, y se estudia en el módulo 6 (especialmente las lecciones 06-02 y 06-04).
Conclusión
Con esta lección se cierra el módulo introductorio y queda dibujado el proceso completo: definir el problema con métrica y baseline, obtener y explorar los datos, preprocesarlos (donde vive la mayor parte del esfuerzo), entrenar, evaluar con rigor sobre datos no vistos, y desplegar con monitoreo continuo, iterando cuantas veces haga falta. Has visto el ciclo entero aplicado al churn de MercaFresh y tienes la tabla que conecta cada fase con su módulo: ese es tu mapa para el resto del curso. El viaje empieza por los cimientos de la fase de exploración: en el módulo 2 estudiaremos los fundamentos de estadística y probabilidad que permiten entender los datos antes de modelarlos.
Curso de Machine Learning
Módulo 1: Introducción al Machine Learning
- ¿Qué es el Machine Learning?
- Historia y evolución del Machine Learning
- Tipos de Machine Learning
- Aplicaciones del Machine Learning
- El flujo de trabajo de un proyecto de Machine Learning
Módulo 2: Fundamentos de Estadística y Probabilidad
- Conceptos básicos de estadística
- Distribuciones de probabilidad
- Correlación y covarianza
- Inferencia estadística
- Teorema de Bayes
Módulo 3: Preprocesamiento de Datos
- Limpieza de datos
- Manejo de datos faltantes
- Transformación de datos
- Codificación de variables categóricas
- Normalización y estandarización
- Ingeniería de características
Módulo 4: Algoritmos de Machine Learning Supervisado
- Regresión lineal
- Regresión logística
- Árboles de decisión
- Máquinas de soporte vectorial (SVM)
- K-Vecinos más cercanos (K-NN)
- Naive Bayes
- Redes neuronales
Módulo 5: Algoritmos de Machine Learning No Supervisado
- Clustering: K-means
- Clustering jerárquico
- Análisis de componentes principales (PCA)
- Análisis de agrupamiento DBSCAN
- Visualización de datos con t-SNE y UMAP
Módulo 6: Evaluación y Validación de Modelos
- División de datos: entrenamiento, validación y prueba
- Métricas de evaluación
- Validación cruzada
- Curva ROC y AUC
- Overfitting y underfitting
Módulo 7: Técnicas Avanzadas y Optimización
- Regularización: Ridge, Lasso y Elastic Net
- Ensemble Learning
- Gradient Boosting
- Redes neuronales profundas (Deep Learning)
- Optimización de hiperparámetros
Módulo 8: Implementación y Despliegue de Modelos
- Frameworks y bibliotecas populares
- Implementación de modelos en producción
- Mantenimiento y monitoreo de modelos
- Consideraciones éticas y de privacidad
Módulo 9: Proyectos Prácticos
- Proyecto 1: Predicción de precios de viviendas
- Proyecto 2: Clasificación de imágenes
- Proyecto 3: Análisis de sentimientos en redes sociales
- Proyecto 4: Detección de fraudes
- Proyecto 5: Segmentación de clientes
