Ya sabemos auditar nuestros modelos (08-01) y entender su contexto social y económico (08-02). La pregunta natural del equipo de TecnoMarket es ahora estratégica: ¿hacia dónde va el campo y qué deberíamos incorporar, vigilar o ignorar? Esta lección ofrece un panorama honesto de las tendencias principales —a nivel conceptual, sin tutoriales—, siempre con la misma vara de medir: ¿qué significa esto para un equipo pequeño con recursos limitados? Igual de importante que conocer las tendencias es saber filtrarlas: el deep learning es un campo con mucho ruido, y distinguir una tendencia consolidada de una moda pasajera es una habilidad profesional en sí misma, con la que cerraremos.
Contenido
- LLMs y modelos fundacionales: la escala como estrategia
- Qué significan los modelos fundacionales para equipos pequeños
- Modelos de difusión: la promesa pendiente de 07-04
- Multimodalidad: texto, imagen y audio en un mismo modelo
- La eficiencia como frontera: el arco MobileNet continúa
- AutoML y búsqueda de arquitecturas, brevemente
- Aprendizaje auto-supervisado: el motor silencioso
- Cómo mantenerse al día sin ahogarse
- Tabla síntesis: tendencias y relevancia para TecnoMarket
LLMs y modelos fundacionales: la escala como estrategia
En 05-05 cerramos el arco histórico que abrimos en 01-02: de la neurona a los transformers y los LLMs. La tendencia que domina el campo desde entonces es la consolidación del modelo fundacional: un modelo enorme, entrenado una vez sobre datos masivos y de propósito general, que después se adapta a mil tareas concretas. Es el patrón del transfer learning de 05-03 llevado al extremo: ya no se preentrena "un modelo de visión para clasificar", se preentrena "un modelo de casi todo".
Tres ideas definen la etapa actual, a nivel de concepto:
- Escala con rendimientos predecibles: hasta ahora, más datos + más parámetros + más cómputo ha seguido produciendo mejoras medibles (las llamadas leyes de escalado). Cuánto durará esa curva es una de las preguntas abiertas del campo — la trataremos con los desafíos en 08-04.
- Ajuste por instrucciones: los LLMs modernos no solo predicen texto (como nuestro modesto generador carácter a carácter de 07-02); se afinan después para seguir instrucciones y ser útiles y seguros en conversación. Es la diferencia entre un motor y un coche conducible.
- RAG y agentes, como idea: un LLM solo sabe lo que vio en su entrenamiento y puede inventar el resto. La generación aumentada con recuperación (RAG) le acopla un buscador: antes de responder, recupera documentos relevantes (el catálogo de TecnoMarket, sus políticas de devolución) y responde apoyándose en ellos, reduciendo invenciones y manteniéndose actualizado sin reentrenar. Los agentes van un paso más allá: el LLM no solo responde, sino que usa herramientas (consultar la base de datos de pedidos, ejecutar una búsqueda) en varios pasos para completar una tarea. Ambos son hoy patrones de ingeniería sobre el modelo, más que cambios en el modelo mismo.
Qué significan los modelos fundacionales para equipos pequeños
Para TecnoMarket, la pregunta no es "¿cómo entreno un LLM?" (no lo hará nunca: 08-02 explicó los costes), sino "¿cómo lo aprovecho?". Las dos rutas, con sus trade-offs:
| Criterio | Consumir vía API | Modelo abierto ajustado en casa |
|---|---|---|
| Calidad inicial | Máxima (modelos de frontera) | Buena, por debajo de la frontera |
| Coste | Por uso; barato al empezar, crece con el volumen | Infraestructura propia + talento; más plano a gran volumen |
| Datos | Salen al proveedor (revisar con legal, 08-01) | Se quedan en casa |
| Dependencia | Alta (precios, versiones, disponibilidad: 08-02) | Baja; el modelo es tuyo |
| Personalización | Limitada al prompt y ajustes ligeros | Fine-tuning completo sobre tu dominio (la habilidad de 05-03/07-05) |
| Mantenimiento | Del proveedor | Tuyo (y no es poco: 06-05) |
La estrategia sensata para un equipo pequeño suele ser híbrida: API para explorar y para lo no sensible; modelo abierto ajustado cuando el volumen, la privacidad o la especialización lo justifiquen. Nota alentadora: el fine-tuning que practicaste en 07-05 con MobileNetV2 es, conceptualmente, la misma operación que ajustar un LLM abierto sobre las reseñas de TecnoMarket. Las habilidades del curso escalan.
Modelos de difusión: la promesa pendiente de 07-04
En 07-04 entrenamos una DCGAN sobre Fashion-MNIST y fuimos honestos con las expectativas: entrenar GANs es inestable (el delicado equilibrio generador-discriminador) y la calidad tiene techo. Prometimos entonces que había algo mejor en camino. Aquí está: los modelos de difusión, que hoy dominan la generación de imagen y vídeo de calidad.
La intuición, sin matemática: en lugar del duelo adversarial de la GAN, la difusión aprende a desruido. Durante el entrenamiento se toma una imagen real y se le añade ruido gradualmente hasta convertirla en estática pura; el modelo aprende a revertir cada pequeño paso: "dado esto ligeramente ruidoso, ¿cómo era un poco más limpio?". Para generar, se parte de ruido puro y se aplican muchos pasos de limpieza sucesivos hasta que emerge una imagen nueva. Como escultura: el ruido es el bloque de mármol y el modelo va quitando lo que sobra, paso a paso.
Por qué han desplazado a las GAN en generación de calidad:
- Entrenamiento estable: es un problema de predicción normal (predecir el ruido añadido), sin el equilibrio inestable entre dos redes que sufrimos en 07-04. Converge de forma aburrida y fiable.
- Cobertura: las GAN tienden al mode collapse (generar solo unas pocas variantes convincentes); la difusión cubre mejor la diversidad de los datos.
- Control: la generación por pasos se guía cómodamente con texto ("una lámpara de diseño nórdico sobre fondo blanco"), que es lo que hace útiles a los generadores de imagen actuales.
- Su precio: generar requiere muchos pasos, luego es más lenta y cara en inferencia que una GAN (que genera en una sola pasada) — aunque las técnicas de reducción de pasos lo mitigan rápido.
¿Las GAN están muertas? No: siguen usándose donde importa la velocidad de inferencia y en tareas específicas, y todo lo que aprendiste en 05-01/07-04 (espacios latentes, entrenamiento de generadores, evaluación de muestras) transfiere directamente. Para TecnoMarket, la implicación práctica es clara: la siguiente generación de su generador de imágenes promocionales no será una GAN entrenada en casa, sino un modelo de difusión guiado por texto — consumido vía API o abierto—, con las reglas de contenido sintético de 08-01 aplicándose exactamente igual.
Multimodalidad: texto, imagen y audio en un mismo modelo
El curso trató cada modalidad por separado: CNN para imágenes (módulo 3), RNN/LSTM para texto y series (módulo 4). La tendencia clara es la fusión: modelos multimodales que entienden y generan texto, imagen y audio conjuntamente, aprendiendo un espacio común donde "la foto de una cafetera" y la frase "cafetera espresso de acero" quedan cerca (una evolución natural de los espacios de representación que vimos en los autoencoders de 05-02).
Para TecnoMarket, la multimodalidad no es ciencia ficción sino hoja de producto:
- Búsqueda visual: el cliente fotografía una lámpara que vio en un bar y encuentra las parecidas del catálogo. (Técnicamente: imágenes y consultas de texto proyectadas al mismo espacio, búsqueda por cercanía.)
- Fichas de producto enriquecidas: un modelo que mira la foto del producto y redacta la descripción coherente con lo que se ve — la fusión de nuestro clasificador (07-01/07-05) y nuestro generador (07-02) en un solo sistema, con la misma revisión humana antes de publicar.
- Atención al cliente con contexto: "¿este cable sirve para el televisor que compré?" respondido entendiendo el texto, el historial y las fotos del producto.
- Control de calidad del catálogo: detectar automáticamente que la foto y la descripción de una ficha se contradicen.
La eficiencia como frontera: el arco MobileNet continúa
Frente a la carrera de la escala, la contra-tendencia igual de importante: hacer más con menos. La conocemos bien: elegimos MobileNetV2 en 07-05 precisamente por eficiente, y en 08-02 vimos la motivación ambiental y económica. Las técnicas que definen esta frontera, a nivel de idea:
- Cuantización: almacenar y computar los pesos con menos bits (de 32 bits a 8, incluso 4). Modelos varias veces más pequeños y rápidos con pérdida de calidad a menudo mínima. Ya la mencionamos al desplegar en 06-05.
- Destilación: entrenar un modelo pequeño ("estudiante") para imitar las salidas de uno grande ("maestro"), heredando gran parte de su rendimiento a una fracción del coste. El maestro se usa una vez; el estudiante sirve en producción.
- Poda: eliminar pesos y neuronas que apenas contribuyen (recuerda cuánta redundancia toleraban las redes en 05-04).
- Edge AI: la suma de las anteriores lleva los modelos al dispositivo: el móvil del cliente ejecuta la búsqueda visual sin enviar la foto a ningún servidor — menos latencia, menos coste de servidor y mejor privacidad (08-01). El escaparate natural del arco MobileNet: la arquitectura ya nació para esto.
Para equipos pequeños esta tendencia es una gran noticia: cada avance en eficiencia acerca capacidades de frontera a presupuestos modestos.
AutoML y búsqueda de arquitecturas, brevemente
Una parte del diseño que hicimos a mano en el curso (cuántas capas, cuántos filtros, qué tasa de aprendizaje) puede automatizarse: AutoML explora configuraciones automáticamente, y su versión ambiciosa, la búsqueda de arquitecturas neuronales (NAS), diseña la propia arquitectura (de hecho, variantes de MobileNet y EfficientNet salieron de procesos de NAS). Lectura honesta para TecnoMarket: la búsqueda de hiperparámetros automatizada es útil y accesible; la NAS completa es cara y raramente rentable frente a partir de una buena arquitectura publicada, que es justo la estrategia (transfer learning) que ya domina el equipo. Tendencia real, pero de relevancia moderada para equipos pequeños: el criterio humano sobre qué problema resolver y con qué datos sigue sin automatizarse.
Aprendizaje auto-supervisado: el motor silencioso
Bajo casi todo lo anterior hay una idea que ya conoces sin saberlo. En 05-02, el autoencoder aprendía representaciones útiles sin etiquetas: su tarea era reconstruir la entrada, y las etiquetas eran... los propios datos. Eso es aprendizaje auto-supervisado: inventar una tarea de pretexto cuyas etiquetas salen gratis de los datos, y usarla para aprender representaciones.
Los modelos fundacionales existen gracias a esta idea llevada a escala:
- Los LLMs se preentrenan prediciendo la siguiente palabra: cada texto de internet trae sus propias "etiquetas" (las palabras siguientes). Nuestro generador de 07-02 hacía exactamente esto, carácter a carácter, en miniatura.
- En visión, tareas de pretexto como reconstruir zonas ocultas de la imagen o aparear vistas distintas de la misma escena producen representaciones que rivalizan con las supervisadas.
Por qué importa: el etiquetado es el cuello de botella (lo sufrimos en cada proyecto del módulo 7, y 08-02 mostró su cara laboral). El auto-supervisado convierte datos sin etiquetar —que sobran— en representaciones, y deja las pocas etiquetas disponibles para el ajuste final. Para TecnoMarket: sus miles de fotos y reseñas sin etiquetar dejan de ser almacenamiento muerto y pasan a ser materia prima de preentrenamiento, propio o ajeno.
Cómo mantenerse al día sin ahogarse
El campo publica más de lo que nadie puede leer, y el marketing infla resultados. Criterios profesionales para filtrar el hype:
- ¿Hay resultados reproducibles? Código y pesos publicados, evaluaciones en benchmarks conocidos hechas por terceros. Desconfía de demos seleccionadas y cifras solo en nota de prensa.
- ¿Resuelve un problema que tienes? La pregunta TecnoMarket. Una tendencia irrelevante para tus casos de uso puede esperar en la lista de vigilancia.
- ¿Sobrevive seis meses? Pocas ideas mueren tan rápido como nacen. Esperar dos ciclos de publicación antes de adoptar filtra la mayor parte del ruido sin perder nada esencial.
- ¿El coste total está contado? Inferencia, mantenimiento, dependencia del proveedor (08-02), auditoría ética (08-01). El paper nunca incluye la factura.
Fuentes estables donde mirar (tipos, más que URLs volátiles): los papers y blogs técnicos de los grandes laboratorios de investigación; las conferencias de referencia del campo (NeurIPS, ICML, ICLR, CVPR para visión, ACL para lenguaje) y su repositorio de preprints (arXiv); la documentación y ejemplos oficiales de los frameworks del módulo 6, que incorporan las técnicas que maduran; encuestas anuales del estado del campo; y comunidades técnicas donde practicantes comparan resultados reales. Una rutina realista: un par de horas semanales fijas, siguiendo pocas fuentes buenas, con lista propia de "vigilar / probar / adoptar".
Tabla síntesis: tendencias y relevancia para TecnoMarket
| Tendencia | Madurez | Relevancia para TecnoMarket | Acción razonable |
|---|---|---|---|
| LLMs / modelos fundacionales | Consolidada y en evolución rápida | Alta: atención al cliente, descripciones, búsqueda | Adoptar vía API con las condiciones de 08-02; evaluar modelo abierto si crece el volumen |
| RAG / agentes | Patrones jóvenes pero ya prácticos | Alta: respuestas basadas en catálogo y políticas reales | Probar en piloto interno antes que de cara al cliente |
| Modelos de difusión | Consolidada en imagen; vídeo en evolución | Media-alta: sustituto natural de la GAN de 07-04 | Adoptar herramienta existente; no entrenar en casa; reglas de 08-01 |
| Multimodalidad | En maduración acelerada | Alta a medio plazo: búsqueda visual, fichas enriquecidas | Vigilar y prototipar la búsqueda visual |
| Eficiencia (cuantización, destilación, edge) | Consolidada y mejorando | Alta: costes, latencia, privacidad | Adoptar cuantización al desplegar; el arco MobileNet siguió siempre esta vía |
| AutoML / NAS | Madura en búsqueda de hiperparámetros; NAS cara | Baja-media | Usar búsqueda de hiperparámetros; NAS no |
| Auto-supervisado | Consolidada como motor de lo fundacional | Media directa (la aprovecha vía modelos preentrenados) | Entender el concepto; explotar datos sin etiquetar cuando toque |
Errores Comunes y Consejos
- Confundir "lo último" con "lo mejor para tu problema". El predictor de demanda de 04-04 con su LSTM y sus baselines puede seguir siendo la solución correcta aunque existan transformers de series temporales. Cambia de técnica cuando una métrica en tus datos lo justifique, no cuando lo diga un titular.
- Adoptar sin ruta de salida. Toda adopción de API o modelo externo debe llevar plan B documentado (08-02). Las tendencias también se discontinúan.
- Ignorar una tendencia porque "eso es de las grandes". Los modelos fundacionales los entrenan pocos, pero se consumen desde cualquier parte: la lección del transfer learning (05-03) es que la frontera llega a los pequeños con uno o dos años de retraso y coste mínimo.
- Leer papers sin gradiente de profundidad. Orden sensato: abstract y figuras de muchos, la introducción de bastantes, el detalle completo de muy pocos. Leerlo todo a fondo no escala; no leer nada te deja a merced del marketing.
- Consejo: mantén viva la tabla síntesis como documento del equipo y revísala cada trimestre: es tu radar tecnológico, barato y honesto.
- Consejo: cuando pruebes una tendencia, hazlo contra un baseline tuyo ya medido (la disciplina de 04-04 y del conjunto congelado de 06-05). "Parece mejor" no es un dato; +3 puntos sobre tu baseline sí.
Ejercicios
Ejercicio 1: renovar el generador de imágenes
Marketing pide "imágenes promocionales mejores que las de nuestra GAN de 07-04". Opciones: (A) mejorar la DCGAN propia con más datos y épocas; (B) usar un servicio de difusión guiada por texto vía API; (C) desplegar un modelo de difusión abierto en infraestructura propia. Evalúa las tres con los criterios de la tabla API vs. abierto y las propiedades de la difusión frente a la GAN, y recomienda una para un equipo de 3 personas, citando qué obligaciones de 08-01 aplican a la elegida.
Ejercicio 2: el chatbot con RAG
Dirección propone un asistente de atención al cliente basado en LLM. El equipo debate entre conectarlo "tal cual" o construir un sistema RAG sobre el catálogo y las políticas de TecnoMarket. Explica con tus palabras qué aporta el RAG en este caso concreto, qué riesgo principal reduce (y por qué ese riesgo existe en un LLM a secas), qué nuevo trabajo de mantenimiento introduce, y qué papel debería tener la revisión humana en la fase inicial.
Ejercicio 3: filtrar el hype
Un proveedor ofrece a TecnoMarket una "plataforma de NAS cuántica-neuronal que diseña automáticamente redes un 40 % mejores, según nuestros estudios internos". Aplica los cuatro criterios de filtrado de hype uno a uno a esta oferta y redacta la respuesta (tres frases) que darías a dirección.
Soluciones
Solución 1. (A) Mejorar la DCGAN: coste de tiempo alto, techo de calidad bajo — 07-04 nos enseñó de primera mano la inestabilidad del entrenamiento adversarial y el riesgo de mode collapse; para calidad promocional real es un callejón sin salida. (B) API de difusión: calidad de frontera inmediata, coste por imagen, cero mantenimiento; riesgos: dependencia del proveedor y salida de datos (aquí menor: los prompts son descripciones de producto, no datos personales — aun así, revisar). (C) Difusión abierta en casa: control y datos propios, pero exige GPU dedicada y competencias de operación que un equipo de 3 no debería gastar en un caso de uso no diferencial. Recomendación: B, con contrato revisado (08-02), y con las obligaciones de 08-01: marcado del contenido como generado, prohibición de fotorrealismo engañoso del producto, revisión humana antes de publicar. Las habilidades de 07-04 no se tiran: sirven para evaluar muestras y entender qué se está comprando.
Solución 2. Qué aporta el RAG: antes de responder, el sistema recupera las fichas y políticas reales de TecnoMarket y el LLM redacta apoyándose en ellas; sin RAG, el LLM responde solo desde su entrenamiento, que no incluye el catálogo actual ni las políticas de la empresa. Riesgo que reduce: respuestas inventadas pero verosímiles — un LLM a secas "rellenará" con seguridad aparente los datos que no tiene (plazos de devolución, compatibilidades), porque su naturaleza es generar texto plausible, la misma que vimos en miniatura en las salidas inventadas de nuestro generador de 07-02. Nuevo mantenimiento: la base de conocimiento recuperable pasa a ser un artefacto vivo — hay que mantenerla sincronizada con el catálogo y las políticas (una ficha desactualizada produce respuestas erróneas con cita incluida), y evaluar periódicamente la calidad de la recuperación. Revisión humana inicial: fase piloto con las respuestas propuestas al agente humano (que aprueba o corrige) antes de exponerlas directamente al cliente — la cola de revisión de 03-04 aplicada al chat; los casos de baja confianza o alto impacto (reclamaciones, pagos) permanecen en humanos incluso después.
Solución 3. Criterio 1 (reproducibilidad): "estudios internos" sin código, pesos ni evaluación de terceros — suspenso; el término "cuántica-neuronal" aplicado como marketing es además una señal clásica de humo. Criterio 2 (problema propio): TecnoMarket no tiene el problema "diseñar arquitecturas": su estrategia ganadora es partir de arquitecturas publicadas con transfer learning (07-05 batió a la CNN propia justamente así). Criterio 3 (supervivencia): no hay adopción conocida de seis meses que verificar. Criterio 4 (coste total): plataforma propietaria = dependencia máxima, coste de NAS alto por naturaleza, sin cifras de inferencia ni mantenimiento. Respuesta a dirección: "La oferta no aporta evidencia verificable de su 40 % y ataca un problema que no tenemos, porque nuestra vía de mejora contrastada es el fine-tuning de arquitecturas públicas. Proponemos declinar y, si el proveedor insiste, pedirle una prueba gratuita medida por nosotros contra nuestro baseline del 91 % sobre nuestro conjunto congelado. Sin esa prueba, no hay caso."
Conclusión
El panorama queda cartografiado: los modelos fundacionales convierten la escala en estrategia y llegan a los equipos pequeños por la doble vía API / modelo abierto ajustado —la decisión estructurada en nuestra tabla—; la difusión salda la promesa de 07-04 sustituyendo el duelo inestable de las GAN por el desruido estable y controlable; la multimodalidad fusiona lo que este curso trató por separado y apunta directo a la búsqueda visual y las fichas enriquecidas de TecnoMarket; la eficiencia (cuantización, destilación, edge) continúa el arco MobileNet y trabaja a favor de los pequeños; el auto-supervisado —el pretexto del autoencoder de 05-02 a escala planetaria— es el motor que lo alimenta todo; y el filtrado del hype con cuatro criterios es la habilidad que mantiene útil todo lo demás. Pero un panorama honesto no puede contar solo lo que avanza: el campo arrastra problemas abiertos serios —modelos que fallan fuera de su distribución, generativos que inventan, sistemas frágiles ante adversarios— y, a la vez, esas grietas son exactamente donde está el trabajo y la oportunidad profesional. De los desafíos y las oportunidades, y del cierre de todo este viaje, trata la última lección del curso.
Curso de Deep Learning
Módulo 1: Introducción a Deep Learning
- ¿Qué es Deep Learning?
- Historia y evolución del Deep Learning
- Aplicaciones de Deep Learning
- Conceptos básicos de redes neuronales
- Preparación del entorno de trabajo
Módulo 2: Fundamentos de Redes Neuronales
- Perceptrón y Perceptrón Multicapa
- Función de activación
- Propagación hacia adelante y hacia atrás
- Optimización y función de pérdida
- Tu primera red neuronal completa
Módulo 3: Redes Neuronales Convolucionales (CNN)
- Introducción a las CNN
- Capas convolucionales y de pooling
- Arquitecturas populares de CNN
- Aplicaciones de CNN en reconocimiento de imágenes
Módulo 4: Redes Neuronales Recurrentes (RNN)
- Introducción a las RNN
- LSTM y GRU
- Aplicaciones de RNN en procesamiento del lenguaje natural
- Secuencias y series temporales
Módulo 5: Técnicas Avanzadas en Deep Learning
- Redes Generativas Adversariales (GAN)
- Autoencoders
- Transfer Learning
- Regularización y técnicas de mejora
- Mecanismos de atención y Transformers
Módulo 6: Herramientas y Frameworks
- Introducción a TensorFlow
- Introducción a PyTorch
- Comparación de frameworks
- Entornos de desarrollo y recursos adicionales
- Guardar, cargar y desplegar modelos
Módulo 7: Proyectos Prácticos
- Clasificación de imágenes con CNN
- Generación de texto con RNN
- Detección de anomalías con Autoencoders
- Creación de una GAN para generación de imágenes
- Fine-tuning de un modelo preentrenado
