Deep Learning (aprendizaje profundo) es la tecnología que hay detrás de los asistentes de voz, los coches que "ven" la carretera, los traductores automáticos y los sistemas que recomiendan qué película ver esta noche. En esta primera lección vamos a definir qué es exactamente, cómo se relaciona con la inteligencia artificial y el machine learning, por qué se llama "profundo" y, sobre todo, cuándo tiene sentido usarlo y cuándo no. Además, presentaremos el caso práctico que nos acompañará durante todo el curso: TecnoMarket, una tienda online de electrónica y hogar que quiere incorporar deep learning a su día a día.
Contenido
- El caso TecnoMarket: el hilo conductor del curso
- Definición de Deep Learning
- IA, Machine Learning y Deep Learning: cómo se relacionan
- ¿Por qué "profundo"? La jerarquía de representaciones
- La diferencia clave con el machine learning clásico
- Cuándo conviene usar Deep Learning (y cuándo no)
El caso TecnoMarket: el hilo conductor del curso
Imagina que trabajas en el equipo de datos de TecnoMarket, una tienda online ficticia que vende electrónica y productos para el hogar. Miles de vendedores suben productos cada día, los clientes escriben reseñas, se procesan pagos y el departamento de marketing necesita material gráfico constantemente. La dirección ha decidido apostar por el deep learning para resolver problemas muy concretos:
- Clasificar automáticamente las fotos de productos que suben los vendedores (¿es un portátil, una cafetera, un televisor?).
- Analizar las reseñas de los clientes para saber si son positivas o negativas sin leerlas una a una.
- Predecir la demanda de productos para gestionar mejor el almacén.
- Detectar transacciones fraudulentas entre los miles de pagos diarios.
- Generar imágenes promocionales para campañas de marketing.
A lo largo del curso, cada técnica que aprendas se planteará como un paso de este proyecto. Antes de aplicar cada técnica a los datos (ficticios) de TecnoMarket, la probaremos con datasets públicos estándar (MNIST, CIFAR-10, IMDB...), que funcionan como "bancos de prueba": son pequeños, están bien documentados y permiten prototipar rápido. Esta forma de trabajar —prototipo con datos públicos, luego aplicación al problema real— es exactamente la que se usa en la industria.
Definición de Deep Learning
Deep Learning es una rama del machine learning que utiliza redes neuronales artificiales con muchas capas para aprender, directamente de los datos, las representaciones necesarias para resolver una tarea.
Desgranemos la definición:
- Rama del machine learning: no es algo separado del aprendizaje automático, sino una familia concreta de técnicas dentro de él.
- Redes neuronales artificiales: modelos matemáticos inspirados (de forma muy libre) en cómo las neuronas del cerebro se conectan entre sí. Veremos sus componentes en la lección 01-04.
- Con muchas capas: de ahí lo de "profundo". Los datos atraviesan varias etapas de transformación, no una sola.
- Aprender directamente de los datos: no programamos reglas a mano; el sistema ajusta sus parámetros internos a partir de ejemplos.
Un ejemplo con TecnoMarket: en lugar de escribir reglas del tipo "si la imagen tiene una pantalla rectangular y un teclado, es un portátil" (algo casi imposible de programar bien), le mostramos al sistema miles de fotos etiquetadas ("esto es un portátil", "esto es una cafetera") y él aprende solo qué patrones visuales distinguen cada categoría.
IA, Machine Learning y Deep Learning: cómo se relacionan
Es muy habitual usar estos tres términos como sinónimos, pero no lo son. Son círculos concéntricos: cada uno está contenido en el anterior.
graph TD
A["Inteligencia Artificial<br/>(cualquier técnica que simule inteligencia)"] --> B["Machine Learning<br/>(sistemas que aprenden de datos)"]
B --> C["Deep Learning<br/>(redes neuronales con muchas capas)"]
| Concepto | Qué es | Ejemplo en TecnoMarket |
|---|---|---|
| Inteligencia Artificial (IA) | Campo amplio: cualquier técnica que permita a una máquina realizar tareas que asociamos con la inteligencia humana. Incluye desde sistemas de reglas escritas a mano hasta los modelos más modernos. | Un chatbot con respuestas predefinidas tipo "si el cliente escribe 'devolución', mostrar el formulario X". |
| Machine Learning (ML) | Subcampo de la IA: sistemas que aprenden patrones de los datos en lugar de seguir reglas programadas explícitamente. | Un modelo que predice si un cliente abandonará el carrito basándose en su historial de navegación, usando un árbol de decisión. |
| Deep Learning (DL) | Subcampo del ML: machine learning con redes neuronales profundas, capaces de aprender representaciones complejas. | Un modelo que mira la foto de un producto y dice a qué categoría pertenece. |
La consecuencia práctica: todo el deep learning es machine learning, y todo el machine learning es IA, pero no al revés. Cuando en una noticia leas "una IA hace X", casi siempre se refieren hoy en día a un sistema de deep learning, pero conviene que tú, como profesional, uses los términos con precisión.
¿Por qué "profundo"? La jerarquía de representaciones
La palabra deep (profundo) no significa "profundo" en el sentido de "inteligente" o "filosófico". Se refiere a algo muy concreto: el número de capas que los datos atraviesan dentro de la red.
Lo interesante es lo que ocurre en esas capas. Cada capa transforma la salida de la anterior en una representación un poco más abstracta. Es lo que se llama jerarquía de representaciones:
- Capas iniciales: detectan patrones muy simples. En una imagen, por ejemplo, bordes, esquinas y manchas de color.
- Capas intermedias: combinan esos patrones simples en formas más complejas: texturas, círculos, rejillas, contornos.
- Capas finales: combinan las formas en conceptos: "rueda", "pantalla", "asa de cafetera".
- Capa de salida: usa esos conceptos para tomar la decisión final: "esto es una cafetera con un 97% de confianza".
graph LR
A[Píxeles de la foto] --> B[Bordes y colores]
B --> C[Texturas y formas]
C --> D["Partes: asa, boquilla, depósito"]
D --> E["Concepto: cafetera"]
La analogía humana es útil: cuando tú reconoces una cafetera, no analizas píxel a píxel de forma consciente. Tu sistema visual también construye jerarquías: luz → contornos → formas → objeto. El deep learning replica esta idea de forma matemática.
Punto clave: nadie programa qué debe detectar cada capa. La red descubre por sí misma qué representaciones intermedias son útiles durante el entrenamiento. Esto nos lleva a la diferencia fundamental con el ML clásico.
La diferencia clave con el machine learning clásico
En machine learning clásico (regresión logística, árboles de decisión, SVM, random forests...), el flujo de trabajo tiene un paso manual crítico: la ingeniería de características (feature engineering). Un humano experto decide qué variables extraer de los datos brutos para dárselas al modelo.
En deep learning, ese paso desaparece: la red recibe los datos brutos (o casi) y aprende ella misma las características relevantes.
| Aspecto | ML clásico | Deep Learning |
|---|---|---|
| Extracción de características | Manual, hecha por expertos | Automática, aprendida por la red |
| Datos de entrada típicos | Tablas de variables ya elaboradas | Datos brutos: imágenes, texto, audio |
| Conocimiento del dominio necesario | Alto (hay que saber qué extraer) | Menor para las características (aunque sigue siendo útil) |
| Rendimiento con pocos datos | Suele ser mejor | Suele ser peor |
| Rendimiento con muchísimos datos | Se estanca | Sigue mejorando |
| Interpretabilidad | Generalmente alta | Generalmente baja ("caja negra") |
Veámoslo con el clasificador de fotos de TecnoMarket, en pseudocódigo conceptual (no es código real de entrenamiento, eso llegará en el módulo 2):
# ENFOQUE CLÁSICO: el humano diseña las características
def extraer_caracteristicas_a_mano(foto):
caracteristicas = {
"proporcion_ancho_alto": calcular_proporcion(foto),
"color_dominante": color_mas_frecuente(foto),
"tiene_bordes_rectos": detectar_lineas(foto),
"cantidad_de_metal": estimar_brillo_metalico(foto),
# ... ¿y cómo describo numéricamente "parece una cafetera"?
}
return caracteristicas
modelo_clasico.entrenar(extraer_caracteristicas_a_mano(fotos), etiquetas)
# ENFOQUE DEEP LEARNING: la red aprende las características sola
modelo_profundo.entrenar(fotos_en_bruto, etiquetas)Fíjate en el problema del enfoque clásico: ¿qué características numéricas distinguen una cafetera de una tetera eléctrica? Es dificilísimo escribirlas a mano, y por eso durante décadas la visión por computador avanzó lentamente. El deep learning eliminó ese cuello de botella: le das las fotos en bruto y las etiquetas, y la jerarquía de representaciones que vimos antes emerge sola del entrenamiento.
Esto no significa que el ML clásico esté obsoleto. Para datos tabulares (una tabla de clientes con edad, gasto mensual y número de pedidos), los métodos clásicos siguen siendo a menudo la mejor opción: más rápidos, más baratos y más interpretables.
Cuándo conviene usar Deep Learning (y cuándo no)
Deep learning es una herramienta potente, pero no es la respuesta a todo. Como futuros responsables técnicos de TecnoMarket, la primera habilidad profesional es saber cuándo aplicarlo.
Conviene usar deep learning cuando...
- Los datos son no estructurados: imágenes, texto libre, audio, vídeo. Es donde el DL arrasa frente al ML clásico.
- Tienes muchos datos (miles o, mejor, millones de ejemplos etiquetados), o puedes aprovechar modelos preentrenados (lo veremos en el módulo 5 con transfer learning).
- El problema es demasiado complejo para reglas manuales: nadie sabe escribir las reglas que definen "reseña sarcástica" o "foto de cafetera".
- La precisión importa más que la explicabilidad: aceptas cierto grado de "caja negra" a cambio de mejores resultados.
- Dispones de recursos de cómputo (GPU) o puedes usarlos en la nube.
NO conviene (o conviene menos) cuando...
- Tienes pocos datos y no hay modelo preentrenado aplicable: con 200 ejemplos, un modelo clásico bien ajustado suele ganar.
- Los datos son tabulares y el problema es sencillo: para predecir si un cliente pagará a tiempo a partir de 10 variables, un gradient boosting clásico probablemente rinda igual o mejor con una fracción del coste.
- Necesitas explicar cada decisión: en contextos regulados (concesión de créditos, diagnósticos), la interpretabilidad puede ser un requisito legal.
- El coste computacional no compensa: entrenar redes profundas consume tiempo, energía y dinero. Un modelo que tarda días en entrenarse para mejorar un 0,5% quizá no justifique la factura.
- Una solución simple ya funciona: la regla de oro de la ingeniería: empieza simple, complica solo si hace falta.
Aplicándolo a TecnoMarket
| Problema de TecnoMarket | ¿Deep learning? | Por qué |
|---|---|---|
| Clasificar fotos de productos | Sí | Imágenes = datos no estructurados; imposible con reglas manuales |
| Analizar sentimiento de reseñas | Sí | Texto libre, matices lingüísticos complejos |
| Predecir demanda con históricos de ventas | Depende | Si hay patrones temporales complejos y muchos datos, sí (módulo 4); si es una serie corta y estable, métodos estadísticos clásicos pueden bastar |
| Detectar fraude | Depende | Combinación habitual: reglas + ML clásico + DL para patrones sutiles |
| Calcular el IVA de una factura | No | Es una fórmula determinista; no hay nada que "aprender" |
Esta tabla resume la mentalidad correcta: el deep learning es un martillo excelente, pero no todo son clavos.
Errores Comunes y Consejos
- Error: usar "IA", "ML" y "deep learning" como sinónimos. Son conjuntos anidados. Precisión terminológica = credibilidad profesional.
- Error: creer que "profundo" significa "más inteligente". Solo se refiere al número de capas. Una red profunda mal entrenada es peor que un modelo simple bien hecho.
- Error: pensar que el deep learning no necesita trabajo humano. Elimina la ingeniería de características manual, pero exige mucho trabajo en datos: recopilarlos, limpiarlos, etiquetarlos. En proyectos reales, el 70-80% del tiempo se va en los datos.
- Error: empezar por deep learning "porque está de moda". Empieza siempre por la solución más simple que pueda funcionar; escala a DL cuando el problema lo justifique.
- Consejo: cuando te propongan un proyecto, hazte tres preguntas: ¿los datos son no estructurados?, ¿cuántos ejemplos tengo?, ¿necesito explicar las decisiones? Con esas tres respuestas, la elección DL vs. ML clásico casi se decide sola.
Ejercicios
Ejercicio 1: Clasifica las técnicas
Indica si cada uno de estos sistemas es IA (sin ML), ML clásico o deep learning:
- Un sistema que bloquea pedidos si el importe supera 5.000 € y la cuenta tiene menos de 7 días (regla fija programada).
- Un árbol de decisión que predice si un cliente devolverá un producto usando 8 variables de su ficha.
- Una red neuronal de 50 capas que identifica el producto que aparece en una foto.
Ejercicio 2: ¿Deep learning sí o no?
Para cada necesidad de TecnoMarket, razona si recomendarías deep learning, ML clásico o ninguna técnica de aprendizaje, y por qué:
- Transcribir automáticamente las llamadas telefónicas del servicio de atención al cliente.
- Calcular los gastos de envío según peso y destino.
- Predecir el gasto anual de un cliente a partir de 12 variables de su ficha, con un histórico de 3.000 clientes.
Ejercicio 3: La jerarquía de representaciones
Explica con tus palabras, en 4 niveles (de lo más simple a lo más abstracto), qué podría aprender cada "zona" de capas de una red profunda que analiza reseñas de texto de TecnoMarket para decidir si son positivas o negativas. (Pista: piensa en el equivalente textual de "bordes → formas → partes → objeto".)
Soluciones
Solución 1:
- IA sin ML: es un sistema de reglas escritas a mano; simula una decisión "inteligente" pero no aprende nada de los datos.
- ML clásico: aprende de datos, pero usa características ya elaboradas (variables de la ficha) y un modelo no neuronal.
- Deep learning: red neuronal con muchas capas trabajando sobre datos brutos (píxeles).
Solución 2:
- Deep learning: el audio es un dato no estructurado y la transcripción de voz es un problema donde el DL es el estado del arte. Además, existen modelos preentrenados que evitan entrenar desde cero.
- Ninguna técnica de aprendizaje: es una fórmula determinista (tarifa por peso y zona). Usar ML aquí sería un error de diseño: añadiría incertidumbre a algo que puede calcularse con exactitud.
- ML clásico: datos tabulares, pocas variables y un dataset modesto (3.000 filas). Un modelo clásico será probablemente igual o más preciso, más rápido de entrenar y más fácil de explicar.
Solución 3 (respuesta orientativa):
- Nivel 1 — unidades básicas: caracteres o palabras sueltas ("perfecto", "roto", "nunca").
- Nivel 2 — combinaciones locales: pares o grupos de palabras con significado conjunto ("no funciona", "muy contento", "volvería a comprar").
- Nivel 3 — estructuras: frases con matices como negaciones, comparaciones o sarcasmo ("esperaba más de esta marca").
- Nivel 4 — concepto global: el sentimiento general de la reseña (positiva/negativa) integrando todo lo anterior.
No hace falta que tu respuesta coincida palabra por palabra: lo importante es la idea de que cada nivel combina los patrones del anterior en algo más abstracto.
Conclusión
En esta lección hemos establecido las bases conceptuales del curso: el deep learning es la rama del machine learning que usa redes neuronales de muchas capas para aprender jerarquías de representaciones directamente de los datos, eliminando la ingeniería de características manual que limita al ML clásico. También hemos visto que no es una bala de plata: brilla con datos no estructurados y abundantes, pero con datos tabulares escasos o problemas deterministas hay opciones mejores y más baratas. Y hemos conocido TecnoMarket, la tienda online que nos servirá de proyecto durante todo el curso.
Ahora que sabes qué es el deep learning, la siguiente pregunta natural es de dónde viene: ¿por qué una idea de los años 50 ha tardado más de medio siglo en cambiar el mundo? Lo descubriremos en la próxima lección, dedicada a la historia y evolución del deep learning.
Curso de Deep Learning
Módulo 1: Introducción a Deep Learning
- ¿Qué es Deep Learning?
- Historia y evolución del Deep Learning
- Aplicaciones de Deep Learning
- Conceptos básicos de redes neuronales
- Preparación del entorno de trabajo
Módulo 2: Fundamentos de Redes Neuronales
- Perceptrón y Perceptrón Multicapa
- Función de activación
- Propagación hacia adelante y hacia atrás
- Optimización y función de pérdida
- Tu primera red neuronal completa
Módulo 3: Redes Neuronales Convolucionales (CNN)
- Introducción a las CNN
- Capas convolucionales y de pooling
- Arquitecturas populares de CNN
- Aplicaciones de CNN en reconocimiento de imágenes
Módulo 4: Redes Neuronales Recurrentes (RNN)
- Introducción a las RNN
- LSTM y GRU
- Aplicaciones de RNN en procesamiento del lenguaje natural
- Secuencias y series temporales
Módulo 5: Técnicas Avanzadas en Deep Learning
- Redes Generativas Adversariales (GAN)
- Autoencoders
- Transfer Learning
- Regularización y técnicas de mejora
- Mecanismos de atención y Transformers
Módulo 6: Herramientas y Frameworks
- Introducción a TensorFlow
- Introducción a PyTorch
- Comparación de frameworks
- Entornos de desarrollo y recursos adicionales
- Guardar, cargar y desplegar modelos
Módulo 7: Proyectos Prácticos
- Clasificación de imágenes con CNN
- Generación de texto con RNN
- Detección de anomalías con Autoencoders
- Creación de una GAN para generación de imágenes
- Fine-tuning de un modelo preentrenado
