En la lección anterior definimos el Machine Learning como la disciplina que permite a los ordenadores aprender de los datos. Pero esta idea no nació ayer: tiene más de setenta años de historia, con épocas de euforia, décadas de decepción (los famosos "inviernos de la IA") y un renacimiento espectacular en los últimos años. Conocer esta evolución es importante por dos razones: entenderás por qué el ML explota precisamente ahora (y no en 1960, cuando ya existían muchas de las ideas), y ganarás perspectiva para no dejarte llevar ni por el bombo publicitario ni por el escepticismo. En esta lección no explicaremos el funcionamiento técnico de los algoritmos que mencionamos; eso llegará en los módulos 4, 5 y 7.

Contenido

  1. Los orígenes: Turing y la pregunta fundacional (1950)
  2. El primer entusiasmo: el perceptrón y los pioneros (1950-1970)
  3. Los inviernos de la IA (1974-1980 y 1987-1993)
  4. El auge estadístico de los años 90
  5. Big data y la industrialización del ML (2000-2012)
  6. La revolución del deep learning (2012-2017)
  7. La era actual: transformers e IA generativa
  8. Tabla cronológica de hitos
  9. ¿Por qué explota ahora? Los tres ingredientes

Los orígenes: Turing y la pregunta fundacional (1950)

En 1950, el matemático británico Alan Turing publicó el artículo Computing Machinery and Intelligence, donde planteó la pregunta "¿pueden pensar las máquinas?" y propuso su famoso test de Turing: si en una conversación por escrito no puedes distinguir si tu interlocutor es una persona o una máquina, la máquina exhibe un comportamiento inteligente.

Lo más visionario del artículo, para nuestro curso, es otra idea: Turing sugirió que en lugar de programar una "mente adulta" con todas sus reglas, sería más práctico construir una "mente de niño" y educarla con ejemplos. Es decir, describió la esencia del Machine Learning décadas antes de que fuera técnicamente posible.

Otros hitos fundacionales de la década:

  • 1956 – Conferencia de Dartmouth: John McCarthy acuña el término Artificial Intelligence. Se considera el acta de nacimiento oficial de la IA como campo de investigación.
  • 1959 – Arthur Samuel: crea un programa que juega a las damas y mejora jugando contra sí mismo. Samuel acuña el término Machine Learning y lo define como "el campo de estudio que da a los ordenadores la capacidad de aprender sin ser programados explícitamente" — la definición intuitiva que vimos en la lección anterior.

El primer entusiasmo: el perceptrón y los pioneros (1950-1970)

En 1958, el psicólogo Frank Rosenblatt presentó el perceptrón, una máquina inspirada (muy libremente) en las neuronas del cerebro, capaz de aprender a clasificar patrones sencillos a partir de ejemplos. Fue el antecesor directo de las redes neuronales actuales (que estudiaremos en la lección 04-07).

La prensa de la época se desató: se llegó a publicar que el perceptrón sería "el embrión de un ordenador capaz de caminar, hablar, ver, escribir y ser consciente de su existencia". Este patrón —expectativas infladas seguidas de decepción— se repetirá varias veces en nuestra historia.

En 1969, Marvin Minsky y Seymour Papert publicaron el libro Perceptrons, demostrando matemáticamente que el perceptrón simple tenía limitaciones severas (no podía resolver ciertos problemas básicos). El libro fue tan influyente que la financiación para redes neuronales prácticamente desapareció.

Los inviernos de la IA (1974-1980 y 1987-1993)

Se llama invierno de la IA a un periodo en el que, tras promesas incumplidas, la financiación y el interés por el campo se desploman. Hubo dos grandes inviernos:

  • Primer invierno (1974-1980): los gobiernos de EE. UU. y Reino Unido recortaron drásticamente la inversión tras informes muy críticos (como el informe Lighthill de 1973) que constataban que los resultados reales estaban lejísimos de lo prometido.
  • Segundo invierno (1987-1993): en los 80 hubo un resurgir gracias a los sistemas expertos (programas con miles de reglas escritas a mano por especialistas humanos: justo el enfoque "tradicional" que vimos en la lección anterior). Funcionaban en dominios muy acotados, pero eran carísimos de mantener y frágiles fuera de su nicho. Cuando el mercado se dio cuenta, la burbuja estalló.

Lección para el presente: los inviernos no llegaron porque las ideas fueran malas, sino porque el hardware y los datos de la época no daban para materializarlas, y porque se prometió más de lo que se podía cumplir. Curiosamente, en pleno segundo invierno (1986), Rumelhart, Hinton y Williams popularizaron la retropropagación (backpropagation), la técnica que décadas después haría posible el deep learning. Las semillas del futuro se plantaron en el invierno.

El auge estadístico de los años 90

En los 90, el campo dio un giro pragmático que lo define hasta hoy: menos ambición de "crear mentes" y más foco en resolver problemas concretos de predicción con fundamentos estadísticos sólidos. El Machine Learning se separó de la IA simbólica y se acercó a la estadística (por eso el módulo 2 de este curso es de estadística y probabilidad).

Hitos de la década:

  • 1995: Cortes y Vapnik presentan las máquinas de soporte vectorial (SVM), que dominarían la clasificación durante 15 años (las veremos en la lección 04-04).
  • 1995-2001: maduran los métodos basados en árboles y sus combinaciones, culminando en Random Forest (Breiman, 2001), antecedente del ensemble learning del módulo 7.
  • 1997: Deep Blue de IBM derrota al campeón mundial de ajedrez Garri Kaspárov. (Matiz: Deep Blue era sobre todo fuerza bruta y reglas, no ML puro, pero cambió la percepción pública de lo que las máquinas podían hacer.)
  • 1998: Yann LeCun aplica redes neuronales convolucionales para leer dígitos manuscritos en cheques bancarios: una de las primeras aplicaciones industriales masivas de redes neuronales.

Para un negocio como MercaFresh, esta década marca el momento en que técnicas como la predicción de demanda o la detección de fraude con modelos estadísticos empezaron a ser viables en empresas reales (bancos y grandes superficies fueron pioneros).

Big data y la industrialización del ML (2000-2012)

Con la explosión de Internet, ocurrió algo decisivo: por primera vez en la historia hubo datos masivos disponibles. Cada compra online, cada clic, cada búsqueda quedaba registrada. Un supermercado online como MercaFresh genera hoy en un día más datos de comportamiento de clientes que una cadena física de los años 80 en un año.

Hitos del periodo:

  • 2006: Netflix lanza el Netflix Prize (un millón de dólares a quien mejorara un 10 % su sistema de recomendación), popularizando las competiciones de ML.
  • 2006: Geoffrey Hinton publica los primeros trabajos sobre redes "profundas" entrenables, acuñándose el término deep learning.
  • 2009: se publica ImageNet, un conjunto de millones de imágenes etiquetadas que se convertiría en el campo de pruebas de la visión por computador.
  • 2007-2010: se generaliza el uso de GPUs (tarjetas gráficas) para entrenar modelos: hardware diseñado para videojuegos que resultó perfecto para las operaciones matriciales del ML.
  • 2010: se funda Kaggle, la plataforma de competiciones de ciencia de datos.

La revolución del deep learning (2012-2017)

El punto de inflexión tiene fecha exacta: 2012. Una red neuronal profunda llamada AlexNet (Krizhevsky, Sutskever y Hinton) arrasó en la competición de ImageNet, reduciendo el error de clasificación de imágenes del ~26 % al ~16 % en un solo año, cuando las mejoras anuales previas eran de décimas. Fue la demostración incontestable de que las redes profundas + muchos datos + GPUs funcionaban.

A partir de ahí, todo se aceleró:

  • 2014: aparecen las GANs (redes generativas antagónicas), capaces de generar imágenes realistas.
  • 2016: AlphaGo (DeepMind) derrota a Lee Sedol al Go, un juego considerado fuera del alcance de las máquinas durante décadas, combinando deep learning con aprendizaje por refuerzo (concepto que presentaremos en la próxima lección).
  • Las grandes tecnológicas reorganizan sus productos alrededor del ML: traducción automática, asistentes de voz, recomendadores.

La era actual: transformers e IA generativa

En 2017, el artículo Attention Is All You Need (Google) presentó la arquitectura transformer, que revolucionó primero el procesamiento del lenguaje y luego casi todo lo demás. Sobre ella se construyeron los grandes modelos de lenguaje (LLM) como GPT o Claude, y en 2022 el lanzamiento de ChatGPT llevó la IA generativa (sistemas que generan texto, imágenes o código) al gran público.

No profundizaremos en estas arquitecturas en este curso (pertenecen al terreno avanzado del deep learning, que solo tocaremos en la lección 07-04), pero conviene situarlas: son la evolución natural de la misma idea que Arthur Samuel formuló en 1959 —aprender de datos—, llevada a escalas de datos y cómputo gigantescas. Y un punto clave para tu carrera: la mayoría de los problemas de negocio reales (predecir demanda, detectar churn, segmentar clientes, como en MercaFresh) se siguen resolviendo con el ML "clásico" que aprenderás en este curso, no con IA generativa.

Tabla cronológica de hitos

Año Hito Protagonista(s) Época
1950 Test de Turing y la idea de "educar" máquinas Alan Turing Orígenes
1956 Conferencia de Dartmouth: nace el término "IA" John McCarthy Orígenes
1958 El perceptrón Frank Rosenblatt Primer entusiasmo
1959 Se acuña "Machine Learning" (programa de damas) Arthur Samuel Primer entusiasmo
1969 Perceptrons: límites del perceptrón simple Minsky y Papert Declive
1974-1980 Primer invierno de la IA — Invierno
1986 Popularización de la retropropagación Rumelhart, Hinton, Williams Semilla en invierno
1987-1993 Segundo invierno (caída de los sistemas expertos) — Invierno
1995 Máquinas de soporte vectorial (SVM) Cortes y Vapnik Auge estadístico
1997 Deep Blue vence a Kaspárov IBM Auge estadístico
2001 Random Forest Leo Breiman Auge estadístico
2006 Nace el término "deep learning" moderno Geoffrey Hinton Big data
2009 ImageNet Fei-Fei Li Big data
2012 AlexNet gana ImageNet: despega el deep learning Krizhevsky, Sutskever, Hinton Revolución
2016 AlphaGo vence a Lee Sedol DeepMind Revolución
2017 Arquitectura transformer Vaswani et al. (Google) Era actual
2022 ChatGPT populariza la IA generativa OpenAI Era actual
timeline
    title Evolución del Machine Learning
    1950-1970 : Origenes y primer entusiasmo : Turing, Dartmouth, perceptron
    1974-1993 : Inviernos de la IA : recortes y desencanto, con semillas como backpropagation
    1990s : Auge estadistico : SVM, arboles, aplicaciones industriales
    2000-2012 : Big data : Internet, GPUs, ImageNet
    2012-2017 : Deep learning : AlexNet, GANs, AlphaGo
    2017-hoy : Era actual : transformers e IA generativa

¿Por qué explota ahora? Los tres ingredientes

Muchas ideas centrales del ML tienen 40 o 60 años. ¿Por qué la explosión llega en la última década? Porque por fin coinciden tres ingredientes que antes faltaban:

  1. Datos: la digitalización de la vida cotidiana genera volúmenes masivos de ejemplos. MercaFresh lo ilustra bien: cada pedido online registra automáticamente docenas de variables (qué, cuándo, cuánto, desde qué dispositivo) que en un supermercado físico de 1990 sencillamente no existían.
  2. Cómputo: las GPUs (y luego chips específicos como las TPUs) multiplicaron por órdenes de magnitud la capacidad de cálculo, y la nube la puso al alcance de cualquiera por horas. Entrenar en 2012 lo que Rosenblatt soñaba en 1958 costaba unos cientos de dólares.
  3. Algoritmos y herramientas: mejoras algorítmicas (retropropagación práctica, nuevas arquitecturas) y, sobre todo, bibliotecas abiertas como scikit-learn (2007), la que usaremos en este curso, que democratizaron técnicas antes reservadas a laboratorios de investigación.

Podemos verlo como una reacción química: los reactivos (ideas) llevaban décadas en el matraz; datos y cómputo fueron el calor que faltaba.

Una forma sencilla de sentir el tercer ingrediente: lo que en los años 90 requería implementar un algoritmo desde cero en C durante semanas, hoy son tres líneas de Python:

# Lo que antes eran meses de trabajo de un laboratorio, hoy es una biblioteca abierta
from sklearn.linear_model import LinearRegression

modelo = LinearRegression()   # un algoritmo con casi 220 años de historia (Gauss/Legendre)
# modelo.fit(X, y)            # y toda la maquinaria moderna para entrenarlo, gratis

Este fragmento es solo un guiño: la regresión lineal que instancia (LinearRegression) tiene raíces en el siglo XIX, y la estudiaremos de verdad en la lección 04-01. La moraleja es histórica: las ideas son viejas; lo nuevo es que ahora cualquiera puede aplicarlas.

Errores Comunes y Consejos

  • Creer que el ML es una moda nacida con ChatGPT. Como has visto, hay 70 años de historia detrás; la IA generativa es el capítulo más reciente, no el primero.
  • Pensar que lo último siempre es lo mejor. Técnicas "veteranas" como la regresión o los árboles siguen ganando en multitud de problemas tabulares de negocio (como los de MercaFresh), con menos coste y más interpretabilidad que el deep learning.
  • Ignorar la lección de los inviernos. Prometer resultados milagrosos a un cliente o a tu dirección es la receta histórica del desencanto. Define expectativas medibles (recuerda la P de Mitchell de la lección anterior).
  • Confundir hitos mediáticos con avances de ML. Deep Blue (1997) fue sobre todo búsqueda por fuerza bruta; AlphaGo (2016) sí fue aprendizaje. Distinguirlos te dará criterio.
  • Consejo: cuando leas noticias sobre IA, sitúalas mentalmente en la línea temporal de esta lección y pregúntate cuál de los tres ingredientes (datos, cómputo, algoritmos) ha hecho posible la novedad.

Ejercicios

Ejercicio 1

Ordena cronológicamente los siguientes hitos y asigna cada uno a su época (orígenes, invierno, auge estadístico, big data, revolución del deep learning, era actual): AlexNet, perceptrón, SVM, transformer, informe Lighthill, ImageNet.

Ejercicio 2

Explica con tus palabras (4-6 líneas) por qué el perceptrón de 1958 no desencadenó entonces la revolución que las redes neuronales protagonizaron a partir de 2012. Apóyate en los "tres ingredientes".

Ejercicio 3

La dirección de MercaFresh ha leído en prensa que "la IA generativa lo va a cambiar todo" y propone abandonar el proyecto de predicción de demanda con ML clásico para "esperar a la nueva ola". Escribe un breve argumento (3-5 líneas) usando lo aprendido en esta lección para responderles.

Soluciones

Solución 1

  1. Perceptrón (1958) — orígenes / primer entusiasmo.
  2. Informe Lighthill (1973) — detonante del primer invierno de la IA.
  3. SVM (1995) — auge estadístico de los 90.
  4. ImageNet (2009) — era del big data.
  5. AlexNet (2012) — revolución del deep learning.
  6. Transformer (2017) — era actual.

Solución 2

El perceptrón contenía la idea correcta (aprender de ejemplos ajustando conexiones), pero en 1958 faltaban dos de los tres ingredientes: apenas había datos digitalizados con los que entrenar, y el cómputo disponible era millones de veces inferior al de una GPU moderna. Además, los algoritmos para entrenar redes de varias capas (como la retropropagación) no se popularizaron hasta 1986. Cuando en 2012 coincidieron datos masivos (ImageNet), hardware adecuado (GPUs) y algoritmos maduros, la misma idea funcionó de forma espectacular.

Solución 3

Argumento posible: "Los problemas tabulares de negocio como la predicción de demanda se resuelven hoy de forma excelente, barata e interpretable con ML clásico, el mismo tipo de técnicas consolidadas desde los años 90-2000. La historia del campo enseña que esperar a la 'próxima ola' prometida es la receta de los inviernos de la IA: promesas infladas y proyectos parados. Lo sensato es capturar valor ahora con técnicas maduras y evaluar las nuevas cuando demuestren ventaja medible en nuestro problema concreto."

Conclusión

Hemos recorrido setenta años de historia: la visión de Turing, el perceptrón de Rosenblatt, los dos inviernos que enfriaron el campo, el giro estadístico de los 90, la era del big data, la explosión del deep learning en 2012 y la actual ola de transformers e IA generativa. La gran conclusión es que las ideas fundamentales son antiguas, y que la revolución actual se explica por la confluencia de tres ingredientes: datos masivos, cómputo barato y algoritmos accesibles a todos. Con esta perspectiva histórica, en la siguiente lección organizaremos el campo por dentro: estudiaremos los tipos de Machine Learning (supervisado, no supervisado, semisupervisado y por refuerzo) y veremos a cuál corresponde cada problema de MercaFresh.

Curso de Machine Learning

Módulo 1: Introducción al Machine Learning

Módulo 2: Fundamentos de Estadística y Probabilidad

Módulo 3: Preprocesamiento de Datos

Módulo 4: Algoritmos de Machine Learning Supervisado

Módulo 5: Algoritmos de Machine Learning No Supervisado

Módulo 6: Evaluación y Validación de Modelos

Módulo 7: Técnicas Avanzadas y Optimización

Módulo 8: Implementación y Despliegue de Modelos

Módulo 9: Proyectos Prácticos

Módulo 10: Recursos Adicionales

© Copyright 2026. Todos los derechos reservados