En las lecciones anteriores hemos visto qué es el deep learning, su historia y sus aplicaciones. Ha llegado el momento de abrir la caja y mirar dentro: ¿de qué está hecha una red neuronal? En esta lección conocerás la neurona artificial y sus componentes (entradas, pesos, sesgo, activación), cómo las neuronas se organizan en capas, qué significa realmente "entrenar" una red, y el vocabulario esencial que usarás durante todo el curso: época, batch, parámetros, y los datasets de entrenamiento, validación y test. Todo a nivel conceptual e intuitivo, con analogías y sin matemáticas pesadas: la formalización llegará en el módulo 2. Dominar este vocabulario ahora te permitirá seguir el resto del curso sin tropiezos.
Contenido
- La neurona artificial: la pieza básica
- Entradas, pesos, sesgo y activación, uno a uno
- De neuronas a redes: las capas
- ¿Qué significa "entrenar" una red?
- Vocabulario esencial: época, batch, parámetros
- Los tres datasets: entrenamiento, validación y test
- Un ejemplo mínimo de código
La neurona artificial: la pieza básica
Una neurona artificial es una unidad de cálculo muy simple que hace tres cosas:
- Recibe varios números de entrada.
- Combina esos números dando más importancia a unos que a otros.
- Emite un único número de salida.
Eso es todo. La potencia del deep learning no viene de que cada neurona sea lista (no lo es: es una calculadora minúscula), sino de conectar miles o millones de ellas en capas, como vimos con la jerarquía de representaciones de la lección 01-01.
Analogía: piensa en una neurona como un miembro del comité de compras de TecnoMarket que decide si conviene reponer stock de un producto. Recibe varios datos (ventas de la semana, unidades en almacén, si hay campaña de marketing próxima), da a cada dato una importancia distinta según su experiencia, lo suma todo mentalmente y emite una opinión: un número entre "reponer sin duda" y "no reponer". El comité completo (la red) combina las opiniones de muchos miembros para llegar a decisiones mucho más finas que las de cualquier miembro individual.
Entradas, pesos, sesgo y activación, uno a uno
Veamos los cuatro componentes con la neurona "¿repongo stock?" como ejemplo:
| Componente | Qué es | En la analogía del comité |
|---|---|---|
| Entradas (x) | Los números que recibe la neurona | Los datos: ventas semanales, stock actual, campaña próxima (sí=1/no=0) |
| Pesos (w) | Un número por cada entrada que indica cuánto importa y en qué sentido | La importancia que el miembro del comité da a cada dato: quizá las ventas pesan mucho (+), el stock alto pesa en contra (−) |
| Sesgo (b) | Un número extra que desplaza el resultado, independiente de las entradas | La predisposición del miembro: uno prudente exige mucha evidencia antes de decir "sí"; uno impulsivo dice "sí" con poco |
| Activación | Una función que transforma la suma en la salida final, introduciendo no linealidad | La forma de expresar la opinión: no dice "suma 7,3", dice algo acotado e interpretable, como "97% a favor" |
El cálculo interno, en versión intuitiva:
Es decir: multiplica cada entrada por su peso, suma todo, añade el sesgo y pasa el resultado por la función de activación.
Dos ideas clave que debes retener:
- Los pesos y el sesgo son lo que la red aprende. Las entradas vienen de los datos; los pesos y sesgos empiezan con valores aleatorios y se van ajustando durante el entrenamiento. Cuando alguien dice que un modelo "tiene 7.000 millones de parámetros", habla de sus pesos y sesgos.
- La activación evita que todo sea una simple suma. Sin ella, por muchas capas que apiles, la red solo podría aprender relaciones lineales (líneas rectas), y el mundo real está lleno de curvas. Hay varias funciones de activación (ReLU, sigmoide...) con propiedades distintas; las estudiaremos en detalle en la lección 02-02, aquí basta con saber para qué están.
De neuronas a redes: las capas
Las neuronas se organizan en capas, y las capas se conectan en cadena. Hay tres tipos:
- Capa de entrada: no calcula nada; simplemente recibe los datos. Tiene una "posición" por cada variable de entrada (o por cada píxel, si es una imagen).
- Capas ocultas: las capas intermedias, donde ocurre la transformación progresiva de los datos. Se llaman "ocultas" solo porque no vemos directamente sus entradas ni salidas desde fuera. Que haya varias capas ocultas es exactamente lo que hace "profunda" a una red (lección 01-01).
- Capa de salida: produce la respuesta final. Su forma depende de la tarea: una neurona por categoría si clasificamos (una para "portátil", otra para "cafetera"...), o una sola neurona si predecimos un número (unidades que se venderán).
Veámoslo con un mini-modelo para TecnoMarket que predice si un cliente comprará (sí/no) a partir de tres datos de su sesión:
graph LR
subgraph Entrada
X1[Minutos en la web]
X2[Productos vistos]
X3[Cliente registrado]
end
subgraph "Capa oculta 1"
H1((n1))
H2((n2))
H3((n3))
H4((n4))
end
subgraph "Capa oculta 2"
G1((n5))
G2((n6))
end
subgraph Salida
Y((¿Comprará?))
end
X1 --> H1 & H2 & H3 & H4
X2 --> H1 & H2 & H3 & H4
X3 --> H1 & H2 & H3 & H4
H1 --> G1 & G2
H2 --> G1 & G2
H3 --> G1 & G2
H4 --> G1 & G2
G1 --> Y
G2 --> Y
Observa que cada neurona de una capa se conecta con todas las de la siguiente (por eso estas capas se llaman "densas" o totalmente conectadas), y cada flecha del diagrama es un peso que la red tendrá que aprender. Cuenta las flechas: 3×4 + 4×2 + 2×1 = 22 pesos, más 7 sesgos (uno por neurona de cálculo) = 29 parámetros. En redes reales, este número se dispara a millones: el mecanismo es idéntico, solo cambia la escala.
¿Qué significa "entrenar" una red?
Aquí está el corazón conceptual del deep learning. Entrenar es ajustar los pesos y sesgos, poco a poco, para que las salidas de la red se acerquen a las respuestas correctas de los ejemplos.
El ciclo, a vista de pájaro:
- Predicción: se le pasa a la red un ejemplo del que conocemos la respuesta (una sesión de cliente que sabemos que acabó en compra).
- Medición del error: se compara lo que dijo la red ("30% de probabilidad de compra") con la realidad ("compró"). La diferencia se resume en un número: el error.
- Ajuste: se modifican ligeramente los pesos y sesgos en la dirección que habría reducido ese error.
- Repetición: se repite con miles de ejemplos, miles de veces. Los errores van bajando y la red va "afinando".
Analogía: es como ajustar los mandos de una ducha desconocida. Abres el grifo (predicción), notas que sale fría (error), giras un poco el mando hacia el rojo (ajuste), vuelves a probar. Nadie te dio el manual de la ducha: llegas a la temperatura perfecta por prueba, medición del error y corrección, no de un salto sino con pequeños ajustes. Ahora imagina una ducha con 29 mandos (nuestro mini-modelo)... o con millones: por eso hace falta un procedimiento automático y sistemático.
Ese procedimiento automático existe y tiene dos piezas con nombre propio: la función de pérdida (cómo se mide el error, lección 02-04) y la retropropagación con su optimizador (cómo se calcula hacia dónde girar cada mando, lección 02-03). En este módulo nos basta con la intuición: entrenar = medir el error y corregir los pesos, en bucle.
Un matiz importante: el objetivo no es memorizar los ejemplos de entrenamiento, sino generalizar: acertar con ejemplos nuevos que la red no ha visto nunca. Esto motiva la separación de datasets que veremos en dos apartados.
Vocabulario esencial: época, batch, parámetros
Estos términos aparecerán en cada lección del curso y en cualquier documentación que leas:
| Término | Significado | Ejemplo con TecnoMarket |
|---|---|---|
| Dataset | El conjunto de ejemplos con los que se trabaja | 50.000 fotos de productos ya etiquetadas con su categoría |
| Ejemplo (muestra) | Un caso individual: entrada + respuesta correcta (etiqueta) | Una foto concreta + la etiqueta "cafetera" |
| Parámetros | Los pesos y sesgos que la red aprende | Los 29 números de nuestro mini-modelo |
| Batch (lote) | Grupo pequeño de ejemplos que se procesan juntos antes de cada ajuste de pesos | En vez de ajustar foto a foto, se procesan de 32 en 32 y se ajusta con el error medio del lote |
| Época (epoch) | Una pasada completa por todo el dataset de entrenamiento | Con 50.000 fotos y batches de 32, una época son 1.563 ajustes |
| Hiperparámetros | Los ajustes que decide el humano, no la red: número de capas, tamaño de batch, número de épocas... | Tú decides entrenar 10 épocas con batches de 32; la red decide sus 29 parámetros |
¿Por qué batches y no todo el dataset de golpe (o ejemplo a ejemplo)? Intuición rápida: procesar todo el dataset por cada ajuste es lento y consume mucha memoria; ajustar con un solo ejemplo hace los ajustes muy erráticos (cada foto individual "tira" en una dirección distinta). El batch es el punto medio práctico: ajustes frecuentes pero estables. Los detalles finos pertenecen a la lección 02-04.
¿Y cuántas épocas? Las necesarias para que el error deje de bajar... sin pasarse. Si entrenas demasiado, la red empieza a memorizar los ejemplos en lugar de generalizar (fenómeno llamado sobreajuste u overfitting, que trataremos a fondo en la lección 05-04). Detectarlo a tiempo es justo el papel del dataset de validación.
Los tres datasets: entrenamiento, validación y test
Nunca se usa todo el dataset para entrenar. Se divide en tres partes con papeles distintos:
| Dataset | % típico | Para qué sirve | Analogía académica |
|---|---|---|---|
| Entrenamiento (train) | 70-80% | Ajustar los pesos: es lo único que la red "estudia" | Los ejercicios del libro con los que estudias |
| Validación (validation) | 10-15% | Comprobar durante el desarrollo si la red generaliza, y elegir hiperparámetros | Los simulacros de examen que haces mientras estudias |
| Test | 10-15% | Evaluación final, con datos jamás usados en el proceso; se mira una sola vez, al final | El examen oficial |
¿Por qué esta disciplina? Porque evaluar la red con los mismos datos con los que entrenó es engañarse: puede haberlos memorizado. Es como valorar a un estudiante preguntándole exactamente los ejercicios que ya hizo: sacaría un 10 sin haber entendido nada. Y el test se reserva intacto porque, si lo usas muchas veces para tomar decisiones, acabas ajustando el modelo (indirectamente) también a él, y pierdes la única medida honesta de cómo funcionará en el mundo real.
Para TecnoMarket: de las 50.000 fotos etiquetadas, 40.000 irían a entrenamiento, 5.000 a validación y 5.000 a test. Cuando presentemos a dirección "el clasificador acierta el 94%", ese 94% deberá venir del test, no del entrenamiento.
Un ejemplo mínimo de código
Para aterrizar el vocabulario, así se ve la definición de nuestro mini-modelo en Keras (la API de alto nivel de TensorFlow). No necesitas ejecutarlo ni entenderlo línea a línea todavía: es solo para que compruebes que los conceptos de esta lección se traducen casi literalmente a código. En la lección 01-05 prepararemos el entorno para ejecutar código, y en el módulo 2 construiremos y entrenaremos una red de verdad paso a paso.
from tensorflow import keras
# Definimos la red del diagrama: 3 entradas -> 4 neuronas -> 2 neuronas -> 1 salida
modelo = keras.Sequential([
keras.layers.Input(shape=(3,)), # capa de entrada: 3 datos por cliente
keras.layers.Dense(4, activation="relu"), # capa oculta 1: 4 neuronas
keras.layers.Dense(2, activation="relu"), # capa oculta 2: 2 neuronas
keras.layers.Dense(1, activation="sigmoid") # salida: probabilidad de compra (0 a 1)
])
modelo.summary() # muestra las capas y cuenta los parámetrosPuntos a observar (sin profundizar aún):
- Cada línea
Dense(...)es una capa de neuronas totalmente conectada con la anterior; el número es cuántas neuronas tiene. activation=es la función de activación de cada capa (los nombresreluysigmoidse explicarán en 02-02).modelo.summary()imprime la tabla de capas y el recuento de parámetros: para esta red, 29, exactamente los que contamos a mano en el diagrama (16+2 de la primera capa oculta, 8+2... en total 22 pesos + 7 sesgos).
Si el recuento del summary() te cuadra con el que hicimos sobre el diagrama, has entendido lo esencial de esta lección.
Errores Comunes y Consejos
- Error: pensar que las neuronas artificiales "funcionan como el cerebro". La inspiración biológica es lejana; una neurona artificial es solo una fórmula de multiplicar, sumar y transformar. Evita razonar sobre redes neuronales con metáforas cerebrales: llevan a conclusiones erróneas.
- Error: confundir parámetros con hiperparámetros. Los parámetros (pesos, sesgos) los aprende la red; los hiperparámetros (capas, batch, épocas) los eliges tú. En conversaciones técnicas se distinguen siempre.
- Error: evaluar el modelo con los datos de entrenamiento. Es el error de principiante más grave: da métricas infladas que se desploman en producción. La cifra que cuenta es la del test.
- Error: usar el dataset de test muchas veces durante el desarrollo. Para eso está el de validación. El test se toca una vez, al final.
- Consejo: cuando leas un término nuevo en el curso, tradúcelo a la pregunta "¿esto lo decide el humano o lo aprende la red?" y "¿esto es una pieza de la red o una pieza del entrenamiento?". Esas dos preguntas ordenan casi todo el vocabulario del deep learning.
Ejercicios
Ejercicio 1: Anatomía de una neurona
Una neurona del sistema antifraude de TecnoMarket recibe tres entradas sobre una transacción: importe (normalizado), 1 si el envío va a una dirección nueva y 0 si no, y número de compras en la última hora. Sus pesos son w = (0,8, 0,9, 0,7) y su sesgo b = −1,5.
- ¿Qué indica el signo positivo de los tres pesos?
- ¿Qué papel juega el sesgo negativo −1,5?
- Sin calcular nada: ¿qué transacción activará más esta neurona, (0,9, 1, 3) o (0,1, 0, 0)? ¿Qué interpreta esta neurona, en palabras?
Ejercicio 2: Cuenta los parámetros
Diseñas para TecnoMarket una red que predice la demanda de un producto a partir de 5 variables de entrada, con una capa oculta de 8 neuronas, otra de 4, y una neurona de salida (el número de unidades previsto). ¿Cuántos pesos, cuántos sesgos y cuántos parámetros totales tiene la red?
Ejercicio 3: Vocabulario en acción
TecnoMarket entrena su clasificador con 40.000 fotos de entrenamiento, batches de 50 y 20 épocas, reservando 5.000 fotos para validación y 5.000 para test.
- ¿Cuántos ajustes de pesos se realizan por época? ¿Y en total?
- Al acabar, el acierto es del 99% en entrenamiento, 91% en validación y 90% en test. ¿Qué cifra darías a dirección como rendimiento esperado en producción? ¿Qué sugiere la diferencia entre el 99% y el 91%?
Soluciones
Solución 1:
- Los tres pesos positivos indican que las tres entradas empujan en la misma dirección: cuanto mayores sean (importe alto, dirección nueva, muchas compras seguidas), mayor será la salida de la neurona.
- El sesgo negativo actúa como un umbral de exigencia: resta 1,5 a la suma, de modo que hacen falta evidencias considerables (entradas altas y bien ponderadas) para que la neurona se active con fuerza. Es la "prudencia" de la neurona.
- La transacción (0,9, 1, 3): todas sus entradas son mayores y los pesos son positivos. En palabras, esta neurona se activa ante "compras caras y aceleradas hacia direcciones nuevas": un patrón sospechoso de fraude. (En una red real, este patrón lo habría descubierto el entrenamiento, no un humano.)
Solución 2:
- Pesos: 5×8 + 8×4 + 4×1 = 40 + 32 + 4 = 76 pesos.
- Sesgos: 8 + 4 + 1 = 13 sesgos (uno por neurona de cálculo; la capa de entrada no tiene).
- Total: 76 + 13 = 89 parámetros.
Solución 3:
- Por época: 40.000 / 50 = 800 ajustes (uno por batch). En total: 800 × 20 = 16.000 ajustes.
- La cifra para dirección es el 90% del test: es la única medida con datos completamente vírgenes. La brecha entre el 99% de entrenamiento y el 91% de validación sugiere sobreajuste: la red ha memorizado en parte los ejemplos de entrenamiento y rinde peor con datos nuevos. Habría que aplicar técnicas de regularización o ajustar el entrenamiento (lo veremos en la lección 05-04).
Conclusión
Ya conoces las piezas del edificio: la neurona artificial (entradas × pesos + sesgo → activación), las capas (entrada, ocultas, salida) que se conectan formando la red, y la idea central de que entrenar es ajustar millones de pesos en bucle midiendo y corrigiendo el error. También manejas el vocabulario imprescindible —parámetros, batch, época, hiperparámetros— y la disciplina de los tres datasets (entrenamiento, validación, test) que separa a los profesionales de los aficionados.
Con la teoría básica en la mochila, solo falta una cosa para empezar a construir: un lugar donde ejecutar código. En la próxima lección prepararemos el entorno de trabajo —Google Colab o instalación local, Jupyter, y la estructura de carpetas del proyecto TecnoMarket— y verificaremos que todo funciona, GPU incluida.
Curso de Deep Learning
Módulo 1: Introducción a Deep Learning
- ¿Qué es Deep Learning?
- Historia y evolución del Deep Learning
- Aplicaciones de Deep Learning
- Conceptos básicos de redes neuronales
- Preparación del entorno de trabajo
Módulo 2: Fundamentos de Redes Neuronales
- Perceptrón y Perceptrón Multicapa
- Función de activación
- Propagación hacia adelante y hacia atrás
- Optimización y función de pérdida
- Tu primera red neuronal completa
Módulo 3: Redes Neuronales Convolucionales (CNN)
- Introducción a las CNN
- Capas convolucionales y de pooling
- Arquitecturas populares de CNN
- Aplicaciones de CNN en reconocimiento de imágenes
Módulo 4: Redes Neuronales Recurrentes (RNN)
- Introducción a las RNN
- LSTM y GRU
- Aplicaciones de RNN en procesamiento del lenguaje natural
- Secuencias y series temporales
Módulo 5: Técnicas Avanzadas en Deep Learning
- Redes Generativas Adversariales (GAN)
- Autoencoders
- Transfer Learning
- Regularización y técnicas de mejora
- Mecanismos de atención y Transformers
Módulo 6: Herramientas y Frameworks
- Introducción a TensorFlow
- Introducción a PyTorch
- Comparación de frameworks
- Entornos de desarrollo y recursos adicionales
- Guardar, cargar y desplegar modelos
Módulo 7: Proyectos Prácticos
- Clasificación de imágenes con CNN
- Generación de texto con RNN
- Detección de anomalías con Autoencoders
- Creación de una GAN para generación de imágenes
- Fine-tuning de un modelo preentrenado
