En 08-01 construimos un método y lo aplicamos al predictor de devoluciones. Un método, sin embargo, se entiende de verdad cuando se ve funcionar (o fallar) en proyectos reales, con presupuestos, presiones y consecuencias que ningún ejercicio reproduce. Esta lección recorre seis casos de estudio de dominio público, elegidos porque cada uno ilustra una fase del ciclo de vida o una técnica del curso: los sistemas de recomendación (del filtrado colaborativo al deep learning, con el Netflix Prize como historia), el diagnóstico por imagen médica con redes convolucionales (promesas y problemas de generalización), AlphaGo y AlphaFold (búsqueda, redes y refuerzo con impacto científico), los sistemas de selección y de scoring que discriminaron (una herramienta de contratación descartada por sesgo de género y el debate sobre COMPAS), los asistentes conversacionales con grandes modelos de lenguaje (y el caso de una aerolínea obligada a cumplir una política que su chatbot inventó) y un fracaso instructivo, Watson for Oncology, junto con el reconocimiento facial policial. Los contamos con prudencia: lo que se afirma es lo que está documentado públicamente, y señalamos dónde simplificamos. Cada caso termina con el paralelo en NovaMarket: qué aprende Marta para su recomendador, su asistente, su predictor o su clasificador de fotos. Es importante porque las lecciones más caras de la IA ya las han pagado otros; el profesional junior que las conoce evita repetirlas.

Contenido

  1. Cómo leer un caso de estudio
  2. Caso 1: sistemas de recomendación, del filtrado colaborativo al deep learning (Netflix Prize)
  3. Caso 2: diagnóstico por imagen médica con CNN (retinopatía diabética, cáncer de piel)
  4. Caso 3: AlphaGo y AlphaFold, de los juegos a la ciencia
  5. Caso 4: selección de personal y scoring con sesgo (la herramienta descartada y COMPAS)
  6. Caso 5: asistentes conversacionales y LLM en atención al cliente (el chatbot de la aerolínea)
  7. Caso 6: un fracaso instructivo, Watson for Oncology (y el reconocimiento facial policial)
  8. Un pequeño ejemplo ejecutable: la lección de equidad en cinco líneas
  9. Tabla resumen: caso → técnica → lección del curso → lección aprendida
  10. Errores Comunes y Consejos
  11. Ejercicios
  12. Conclusión

  1. Cómo leer un caso de estudio

Los casos de éxito y fracaso en IA se cuentan a menudo como titulares ("la IA supera a los médicos", "el algoritmo racista"). Para aprender de ellos hay que leerlos con la plantilla de 08-01: contexto (quién, para qué, con qué presión), problema (la pregunta y la decisión que cambia), técnica (qué modelo y por qué; lo enlazamos con la lección del curso donde se vio), resultado (lo que se midió, y lo que no), lecciones (qué fase del ciclo falló o funcionó) y, para nosotros, el paralelo en NovaMarket. Y con dos cautelas: muchas cifras célebres proceden de comunicados de las propias empresas o de artículos que después se matizaron, y en varios casos hubo litigios o versiones enfrentadas. Cuando decimos "según informes públicos" es porque no hay una fuente única e indiscutible.

  1. Caso 1: sistemas de recomendación, del filtrado colaborativo al deep learning (Netflix Prize)

Contexto. A principios de los años 2000, el comercio electrónico y las plataformas de contenido descubrieron que la mayor parte de lo que vendían no cabía en una portada: hacía falta una portada distinta para cada cliente. Amazon publicó en 2003 su método de filtrado colaborativo ítem a ítem ("los clientes que compraron esto también compraron aquello"), el mismo principio que programamos en 01-03 para NovaMarket. En 2006, Netflix, entonces un servicio de alquiler de DVD por correo, convocó el Netflix Prize: un millón de dólares para el primer equipo que mejorara en un 10 % el error (RMSE, 04-05) de su sistema Cinematch al predecir las valoraciones de una a cinco estrellas, sobre un conjunto de unos cien millones de valoraciones anonimizadas.

Problema. Predecir qué valoración dará un usuario a una película que no ha visto (regresión, 04-02) para ordenar el catálogo. La decisión que cambia: qué títulos se muestran primero.

Técnica. El concurso, que duró hasta 2009, popularizó la factorización de matrices: representar cada usuario y cada película con un vector de factores latentes (la idea de los embeddings de 05-04) cuyo producto escalar predice la valoración; y demostró el poder de los conjuntos de modelos (ensembles, 04-04): el equipo ganador combinaba cientos de modelos. Con la llegada del streaming, las plataformas pasaron de las valoraciones explícitas a las señales implícitas (qué se reproduce, cuánto tiempo, qué se abandona) y, en la década de 2010, a redes neuronales profundas que combinan embeddings de usuario, contenido y contexto (05-04), como describió YouTube en un artículo muy citado de 2016.

Resultado. El premio se entregó en 2009. Pero Netflix explicó públicamente años después que la solución ganadora completa no llegó a desplegarse tal cual: el coste de ingeniería de mantener cientos de modelos en producción no compensaba la mejora, y el negocio había cambiado (del DVD y las estrellas al streaming y las señales implícitas). Además, investigadores demostraron que el conjunto de datos "anonimizado" permitía reidentificar a algunos usuarios cruzándolo con valoraciones públicas de otro sitio, lo que derivó en una demanda y en la cancelación de una segunda edición del concurso.

Lecciones.

  • La métrica del concurso no era la métrica del negocio: mejorar el RMSE un 10 % no equivale a que la gente vea más o cancele menos. Es el error 3 de 08-01 (métrica equivocada) a escala de un millón de dólares.
  • La complejidad tiene un coste de despliegue y mantenimiento (fase 6-7): un modelo un 1 % mejor que exige diez veces más ingeniería puede ser peor decisión.
  • La anonimización no es trivial (02-03, 02-04): quitar nombres no basta cuando los datos son ricos.
  • El modelo simple primero (filtrado colaborativo, factorización) sigue siendo la línea base que hay que batir antes de una red profunda.

El paralelo en NovaMarket. Para el recomendador (caso 1), Marta empieza por el filtrado colaborativo ítem a ítem de 01-03 con datos de compra y navegación como línea base; define la métrica de negocio en el documento de definición (ingresos y clics del bloque "también te puede interesar", medidos con A/B, ejercicio 3 de 08-01), no el error de una valoración; y trata los historiales de compra como datos personales, sin publicarlos ni compartirlos "anonimizados" a la ligera. Si un modelo más complejo mejora el clic un 1 % pero exige un servicio nuevo, la decisión es de negocio, no de la métrica.

  1. Caso 2: diagnóstico por imagen médica con CNN (retinopatía diabética, cáncer de piel)

Contexto. La retinopatía diabética es una causa importante de ceguera evitable; su cribado exige que un especialista examine fotografías del fondo del ojo, y hay muchos más pacientes que especialistas. En 2016 un equipo de Google publicó en una revista médica un estudio en el que una red convolucional (05-04), entrenada con más de cien mil fotografías etiquetadas por oftalmólogos, alcanzaba una sensibilidad y una especificidad comparables a las de los especialistas en dos conjuntos de validación. En 2017 otro grupo (Stanford) publicó en Nature un clasificador de lesiones cutáneas entrenado con una CNN que, en las pruebas del estudio, se comportaba al nivel de dermatólogos al distinguir lesiones malignas de benignas.

Problema. Clasificación de imágenes (04-02): a partir de una foto, ¿hay signos de enfermedad que justifiquen derivar al especialista? La decisión que cambia: a quién se deriva y con qué prioridad.

Técnica. Redes convolucionales preentrenadas y ajustadas (transfer learning, 05-04), exactamente lo que hicimos con la CNN de fotos de incidencias de NovaMarket (98,7 % en nuestro caso ficticio), con muchas más imágenes y etiquetas de varios especialistas por imagen para reducir el ruido de etiquetado.

Resultado. Los resultados de laboratorio fueron sólidos y abrieron un campo entero. Pero el paso a la clínica enseñó las limitaciones que hoy conoce todo el sector: cuando el sistema de retinopatía se probó en clínicas reales de Tailandia (estudio publicado en 2020), una parte considerable de las imágenes tomadas en condiciones reales (iluminación, cámaras, enfermeras con poca formación específica) no cumplía la calidad que el modelo exigía y era rechazada, lo que generaba trabajo extra y frustración; y el flujo de trabajo (conexión a internet, tiempos de espera) importaba tanto como el AUC. En dermatología se documentó que los conjuntos de datos tenían poca representación de pieles oscuras, y que algunos modelos aprendían atajos: marcas de rotulador quirúrgico o reglas de medida presentes sobre todo en las fotos de lesiones malignas, que el modelo usaba como pista. En radiografías de tórax se mostró que un modelo podía reconocer el hospital de origen de la imagen (por el aparato o las etiquetas incrustadas) y aprovecharlo, con lo que su rendimiento caía en hospitales nuevos.

Lecciones.

  • Generalización entre centros (04-06): un modelo validado con datos de los mismos hospitales que lo entrenaron no está validado para otros. La validación debe hacerse en centros distintos y en condiciones reales.
  • Fugas y atajos (04-03): las reglas y los rotuladores son la versión médica de motivo_devolucion.
  • Sesgo de muestreo (02-03, 02-04): si un grupo apenas está en los datos, el rendimiento sobre él es desconocido, no "igual".
  • El despliegue es un problema de flujo de trabajo (08-01, fase 6): la calidad de la imagen, el tiempo de respuesta y la formación de quien usa el sistema deciden tanto como el modelo. Y siempre con revisión humana proporcional al riesgo: es alto riesgo en el AI Act (02-04).

El paralelo en NovaMarket. El clasificador de fotos de incidencias (caso 9, 05-04) se entrenó con fotos hechas por el equipo de Zaragoza con buena luz; antes de generalizarlo, Marta prueba con fotos de clientes hechas con el móvil en casa (peor luz, encuadre, resolución) y con las de Getafe, mide por almacén y por tipo de dispositivo, y añade una comprobación de calidad de imagen que pide otra foto en lugar de clasificar mal. Y busca atajos: ¿aprende la red que "hay embalaje NovaMarket en la foto" en vez del defecto?

  1. Caso 3: AlphaGo y AlphaFold, de los juegos a la ciencia

Contexto. El Go era el gran juego pendiente de la IA: su árbol de jugadas es tan grande que la búsqueda con función de evaluación escrita a mano, que bastó a Deep Blue en ajedrez (03-03), no funcionaba. En 2016 AlphaGo, de DeepMind, venció a Lee Sedol, uno de los mejores jugadores del mundo, por 4 a 1 (01-01). Su sucesor AlphaGo Zero aprendió sin partidas humanas, solo jugando contra sí mismo, y superó al original. En 2020, la misma empresa presentó AlphaFold 2 en la competición CASP de predicción de estructura de proteínas, con una precisión que para muchas proteínas rivalizaba con los métodos experimentales; después publicó una base de datos con predicciones para cientos de millones de proteínas, y en 2024 sus principales autores compartieron el Premio Nobel de Química con David Baker.

Problema. En el Go: decidir la mejor jugada (búsqueda con adversario, 03-03) en un espacio inabarcable. En las proteínas: predecir la forma tridimensional de una proteína a partir de su secuencia de aminoácidos, un problema abierto durante décadas y clave para entender enfermedades y diseñar fármacos.

Técnica. AlphaGo combinó búsqueda en árbol Monte Carlo (una búsqueda que muestrea partidas en lugar de recorrer todo el árbol, en la familia de 03-02/03-03) con dos redes profundas, una que propone jugadas y otra que evalúa posiciones (05-04), entrenadas primero con partidas humanas y luego por aprendizaje por refuerzo jugando contra sí misma (04-02). AlphaFold 2 es un sistema de redes con atención (05-05) sobre secuencias relacionadas evolutivamente y sobre las relaciones geométricas entre aminoácidos, entrenado con las estructuras experimentales conocidas y, en parte, con sus propias predicciones de alta confianza. Simplificamos mucho: ambos sistemas son ingeniería de investigación de gran escala.

Resultado. Más allá del titular, lo relevante es el impacto científico: la predicción de estructuras dejó de ser el cuello de botella de muchos proyectos de biología, y las técnicas (búsqueda + redes + refuerzo, atención sobre datos estructurados) se han extendido a la química de materiales, la predicción meteorológica o el control de sistemas físicos.

Lecciones.

  • La combinación de técnicas gana: búsqueda simbólica (módulo 3) más redes (módulo 5) más refuerzo, no una sola herramienta. Es el argumento neurosimbólico de 06-04 visto desde otro ángulo.
  • El problema estaba bien definido y era medible: ganar partidas; una métrica de precisión sobre estructuras conocidas en una competición ciega. Los grandes éxitos de la IA tienen medida de rendimiento clara (02-01).
  • Los datos existían: décadas de estructuras experimentales depositadas en una base pública. Sin ellas no hay AlphaFold.
  • Cuidado con la extrapolación: superar a un campeón de Go no significa que "la IA sea más lista que las personas"; es IA estrecha (02-02) en un entorno completamente observable y de reglas fijas.

El paralelo en NovaMarket. No va a entrenar un AlphaGo, pero la lección de "combinar búsqueda y modelos" ya la aplica: las rutas de la furgoneta (03-04) mejoran si la estimación de tiempos por tramo la da un modelo aprendido en vez de una constante; y el aprendizaje por refuerzo es candidato, a medio plazo, para políticas de reposición de stock, siempre con una simulación previa (nunca aprender a base de errores con clientes reales). Y la lección de los datos: si NovaMarket quiere modelos buenos dentro de tres años, tiene que empezar hoy a guardar bien lo que pasa (fechas, decisiones, resultados), como hicieron los biólogos con las estructuras.

  1. Caso 4: selección de personal y scoring con sesgo (la herramienta descartada y COMPAS)

Contexto (a). Según informó la prensa en 2018, un gran grupo tecnológico había desarrollado internamente una herramienta para puntuar currículos y así preseleccionar candidatos, entrenada con los currículos recibidos durante unos diez años. El equipo descubrió que el sistema penalizaba los currículos que contenían la palabra "women's" (por ejemplo, "capitana del club de ajedrez femenino") y los de graduadas de determinadas universidades femeninas, porque el histórico de contrataciones en puestos técnicos estaba dominado por hombres. Se intentó corregir neutralizando esos términos, pero no había garantía de que el modelo no encontrara otros indicios, y el proyecto se abandonó.

Contexto (b). COMPAS es una herramienta comercial usada en varios estados de Estados Unidos para estimar el riesgo de reincidencia de personas acusadas o condenadas, con influencia en decisiones judiciales. En 2016 una investigación periodística analizó miles de casos y concluyó que, entre las personas que no reincidieron, las de raza negra habían recibido puntuaciones de alto riesgo con mucha más frecuencia que las blancas (más falsos positivos), y al revés con los falsos negativos. La empresa respondió que la herramienta estaba calibrada por igual para ambos grupos (una puntuación de 7 significaba la misma probabilidad de reincidencia fuera cual fuera la raza). Investigadores demostraron después que, cuando las tasas base difieren entre grupos, es matemáticamente imposible satisfacer a la vez la calibración y la igualdad de tasas de error: hay que elegir qué noción de equidad se prioriza, y esa elección no es técnica.

Problema. Clasificación supervisada (04-02) sobre personas: ¿es buen candidato? ¿reincidirá? La decisión que cambia: quién pasa a entrevista; qué medida cautelar se aplica.

Técnica. Modelos supervisados entrenados sobre decisiones humanas pasadas como etiqueta. Ahí está la raíz: el modelo aprende a imitar el pasado, con sus sesgos, y los codifica en proxies (palabras, códigos postales, historial) aunque se elimine la característica protegida (02-04, sección 3).

Resultado. La herramienta de selección se descartó antes de usarse para decidir; COMPAS sigue en uso en algunos lugares en medio de un debate abierto sobre equidad, transparencia (el modelo es propietario y opaco) y responsabilidad.

Lecciones.

  • La etiqueta puede estar sesgada: "contratado" o "reincidió" (en realidad, "detenido de nuevo") no son la verdad neutral que parecen (02-03).
  • Quitar la columna protegida no elimina el sesgo si hay proxies; hay que medir por grupo (02-04, sección 10) y decidir con qué métrica.
  • Hay que elegir la definición de equidad antes de entrenar, con juristas y afectados, y documentarla (evaluación de impacto).
  • Alto riesgo: empleo y justicia son ámbitos de alto riesgo en el AI Act; opacidad más impacto en personas es la combinación que exige revisión humana efectiva y derecho a explicación (RGPD).

El paralelo en NovaMarket. El predictor de devoluciones no decide sobre empleo ni justicia, pero sí sobre clientes: la lección de 02-04 (marcar al 90 % de una zona y al 20 % de otra con la misma tasa real) es este caso en pequeño. Por eso el documento de definición de 08-01 fija un ratio de impacto ≥ 0,8 entre zonas, la model card dice que codigo_postal_zona no decide sin revisión, y el calendario de monitorización mide la paridad cada mes. Y si algún día RR. HH. pide "un modelo que ordene candidaturas", Marta sabe que la primera pregunta no es qué algoritmo, sino qué dice el histórico y quién responde.

  1. Caso 5: asistentes conversacionales y LLM en atención al cliente (el chatbot de la aerolínea)

Contexto. Desde 2023 muchas empresas han incorporado asistentes basados en grandes modelos de lenguaje (05-05) a su atención al cliente, para responder preguntas frecuentes, consultar el estado de un pedido o resolver gestiones sencillas. Los resultados publicados por las propias empresas suelen ser positivos (más consultas resueltas sin agente, menor tiempo de espera), aunque son cifras de comunicados y hay que leerlas como tales. Y hay casos públicos de lo contrario. El más citado: un cliente de una aerolínea canadiense preguntó al chatbot de la web por las tarifas por duelo; el chatbot le dijo que podía comprar el billete y pedir el reembolso parcial después del viaje, algo que la política real de la compañía no permitía. Cuando la aerolínea se negó al reembolso, el cliente acudió a un tribunal de pequeñas reclamaciones. La compañía alegó que el chatbot era una "entidad separada" responsable de sus propias palabras; el tribunal lo rechazó en 2024 y la obligó a honrar lo que el chatbot había dicho: la información de su web, la dé una página o un chatbot, es responsabilidad de la empresa. Otros casos públicos incluyen chatbots de reparto que, provocados por el usuario, insultaron a la propia empresa o compusieron poemas contra ella, y sistemas que "confirmaron" descuentos inexistentes.

Problema. Responder en lenguaje natural preguntas sobre políticas, pedidos y productos, con la decisión que cambia siendo, a menudo, una promesa al cliente.

Técnica. LLM con instrucciones (prompting), idealmente con RAG (05-05): recuperar los fragmentos de la política real y responder solo a partir de ellos; y con reglas de validación a la salida (06-04, ejercicio 3: si la respuesta contiene una cifra de dinero, un plazo o una promesa, comprobarla contra la fuente o derivar a un agente).

Resultado. Los asistentes bien delimitados funcionan y ahorran trabajo; los que se despliegan sin acotar el alcance ni verificar las respuestas alucinan políticas y comprometen a la empresa. La lección jurídica es nítida: la empresa responde por lo que dice su chatbot.

Lecciones.

  • La alucinación no es un fallo raro, es una propiedad de los modelos generativos (05-05, sección 11): el diseño debe suponer que ocurrirá.
  • RAG + fuentes citadas + validación por reglas (neurosimbólico, 06-04) reducen el riesgo; y para lo que compromete dinero, derivar a una persona.
  • Registro y evaluación continua de conversaciones (08-01, fase 7): muestreo semanal de respuestas revisadas por el equipo de atención al cliente, y pruebas adversarias antes de desplegar.
  • Responsabilidad (02-04): la respuesta del chatbot es una comunicación de la empresa; legal debe revisar el alcance.

El paralelo en NovaMarket. El asistente (caso 7) que diseñamos con RAG en 05-05 responde solo con fragmentos de la política de devoluciones y las fichas de producto, cita el fragmento, y las reglas de 06-04 bloquean cualquier respuesta con importes, plazos o promesas no verificados y la derivan a una persona; nunca confirma un reembolso: crea la solicitud y la deja en la cola de Diego. En la model card del asistente, el "uso no previsto" incluye "comprometer condiciones comerciales". Y Marta añade al calendario de monitorización el muestreo semanal de 50 conversaciones revisadas por atención al cliente.

  1. Caso 6: un fracaso instructivo, Watson for Oncology (y el reconocimiento facial policial)

Contexto. Tras ganar el concurso Jeopardy! en 2011 (01-01), IBM presentó Watson como plataforma para muchos sectores, y en particular Watson for Oncology, un sistema para recomendar tratamientos oncológicos, desarrollado con un prestigioso centro oncológico estadounidense y comercializado a hospitales de varios países. Según informes públicos de prensa especializada y de una auditoría universitaria (2017-2018), el proyecto sufrió varios problemas: una parte del entrenamiento se hizo con casos hipotéticos preparados por especialistas del centro, no solo con historiales reales; las recomendaciones reflejaban las prácticas de ese centro y no siempre encajaban con las guías o los recursos de hospitales de otros países; documentos internos filtrados a la prensa describían recomendaciones "inseguras e incorrectas" en pruebas; y un gran hospital de Texas canceló su proyecto de varios años tras un gasto que la auditoría cifró en decenas de millones de dólares, sin llegar a usarse con pacientes. La división de salud de IBM se vendió en 2022. Simplificamos una historia larga y con versiones enfrentadas; lo que no se discute es la distancia entre la expectativa creada y el resultado.

Problema. Recomendar tratamientos personalizados a partir de la historia clínica y de la literatura médica; la decisión que cambia, la de un oncólogo sobre un paciente. Un problema con etiquetas escasas y discutibles, datos heterogéneos y máximo riesgo.

Técnica. Sistemas de procesamiento de lenguaje y recuperación de información de la época (anteriores a los transformers de 05-05), combinados con conocimiento curado por especialistas: en el fondo, un sistema experto (06-02) alimentado con datos y con literatura, cuya "base de conocimiento" resultó estar sesgada hacia un centro.

Resultado. Retirada progresiva del producto y una lección para todo el sector sobre la sobreexpectativa (los inviernos de 01-01 empezaban así) y sobre la diferencia entre ganar un concurso de televisión y ayudar en una consulta.

Reconocimiento facial policial (breve). Un caso paralelo: en 2018 un estudio académico (Gender Shades) mostró que varios sistemas comerciales de clasificación de rostros tenían tasas de error mucho mayores en mujeres de piel oscura que en hombres de piel clara, por conjuntos de entrenamiento poco representativos; después se documentaron en Estados Unidos detenciones erróneas de personas negras identificadas por sistemas de reconocimiento facial policial. Varias ciudades restringieron o prohibieron su uso policial, algunas empresas dejaron de venderlo a la policía y el AI Act europeo restringe severamente la identificación biométrica remota en espacios públicos (02-04).

Lecciones.

  • Datos que no representan la realidad de uso (casos hipotéticos de un centro; rostros de un solo grupo): el modelo aprende otro problema (fase 2 de 08-01).
  • Validación externa antes de vender: ningún despliegue en un país nuevo sin evaluar con datos y guías de ese país (04-06, generalización).
  • La sobreexpectativa mata proyectos (01-01): prometer "curar el cáncer" con un sistema de recomendación crea una deuda imposible de pagar.
  • En alto riesgo, la revisión humana debe ser real, no un botón de "aceptar" que se pulsa por confianza en la máquina (sesgo de automatización, 02-04).
  • Medir por grupo es obligatorio cuando el error tiene consecuencias graves; y para ciertos usos, la respuesta correcta es no desplegar.

El paralelo en NovaMarket. El diagnóstico de incidencias (caso 9: la red bayesiana de 06-03 más la CNN de fotos) es el "Watson" de NovaMarket a pequeña escala: su conocimiento viene de los técnicos de Zaragoza. Antes de usarlo en Getafe, Marta valida con incidencias de Getafe, no promete "resolver todas las incidencias" sino "proponer un diagnóstico que el técnico confirma o corrige" y registra cada corrección para mejorar las tablas de probabilidad. Y sobre el reconocimiento facial, la lección para el futuro: si alguien propone "identificar clientes por la cámara de la tienda física" o "detectar fraude por la foto del DNI", la respuesta empieza por la evaluación de impacto y por legal, no por el modelo.

  1. Un pequeño ejemplo ejecutable: la lección de equidad en cinco líneas

El caso 4 se puede reproducir en miniatura con datos ficticios, aplicando la paridad de tasas de 02-04. Simulamos un histórico de candidaturas en el que la decisión pasada dependía de la experiencia y de un sesgo contra un grupo, y en el que una palabra del currículo actúa de proxy del grupo. Después hacemos lo que hizo el equipo del caso real: quitar la columna del grupo y entrenar con el resto.

import numpy as np, pandas as pd
from sklearn.linear_model import LogisticRegression

rng = np.random.default_rng(42)
n = 2000
# Candidaturas ficticias a un puesto técnico. La etiqueta 'contratado_historico' arrastra el sesgo del pasado.
genero = rng.choice(["mujer", "hombre"], size=n, p=[0.35, 0.65])
experiencia = rng.integers(0, 15, size=n)
# proxy: en el histórico, ciertas palabras del CV (p. ej. "club femenino") aparecen casi solo en un grupo
palabra_proxy = np.where(genero == "mujer", rng.random(n) < 0.6, rng.random(n) < 0.05).astype(int)
# la decisión histórica dependía de la experiencia... y de un sesgo contra un grupo
z = -2 + 0.25 * experiencia - 1.2 * (genero == "mujer")
contratado = (rng.random(n) < 1 / (1 + np.exp(-z))).astype(int)
cv = pd.DataFrame({"genero": genero, "experiencia": experiencia,
                   "palabra_proxy": palabra_proxy, "contratado_historico": contratado})

# "Solución ingenua": quitar la columna genero y entrenar con el resto
X = cv[["experiencia", "palabra_proxy"]]
modelo = LogisticRegression().fit(X, cv["contratado_historico"])
cv["recomendado"] = modelo.predict(X)

tasas = cv.groupby("genero")["recomendado"].mean()
print("Tasa de recomendación por grupo:\n", tasas.round(3).to_string())
print(f"Ratio de impacto: {tasas.min() / tasas.max():.2f}  (regla de los cuatro quintos: >= 0,80)")
print("Coeficiente de la palabra proxy:", round(float(modelo.coef_[0][1]), 2))

Salida (ejecutada en el entorno del curso):

Tasa de recomendación por grupo:
 genero
hombre    0.348
mujer     0.193
Ratio de impacto: 0.56  (regla de los cuatro quintos: >= 0,80)
Coeficiente de la palabra proxy: -1.1

Explicación: el modelo nunca ha visto la columna genero y, sin embargo, recomienda al 35 % de los hombres y al 19 % de las mujeres (ratio 0,56, muy por debajo de 0,8). Lo consigue a través del proxy: el coeficiente de palabra_proxy es −1,1, es decir, la presencia de la palabra reduce fuertemente la puntuación, porque en el histórico esa palabra iba asociada a candidaturas que se rechazaban por otro motivo. Es exactamente lo que se relató en el caso real, y es la razón por la que la medición por grupo de 02-04 es obligatoria aunque el modelo "no use" la característica protegida. Corregirlo de verdad exige actuar sobre la etiqueta (¿qué histórico es aceptable como verdad?), sobre las características (¿qué palabras entran?) y sobre la decisión (revisión humana, cuotas de entrevista, o no automatizar).

  1. Tabla resumen: caso → técnica → lección del curso → lección aprendida

Caso Técnica principal Lección del curso Fase del ciclo (08-01) que enseña Lección aprendida Paralelo en NovaMarket
Recomendación (Netflix Prize) Filtrado colaborativo, factorización, embeddings + redes 01-03, 04-04, 05-04 1 (métrica), 6-7 (coste de despliegue) La métrica del concurso no es la del negocio; la complejidad se paga en producción; anonimizar es difícil Recomendador (caso 1): línea base colaborativa, A/B sobre ingresos, cuidado con los datos
Diagnóstico por imagen CNN, transfer learning 05-04 2 (datos), 5 (validación externa), 6 (flujo) Generalización entre centros, atajos, grupos infrarrepresentados, el flujo de trabajo decide Fotos de incidencias (caso 9): validar en Getafe y con fotos de clientes, control de calidad de imagen
AlphaGo / AlphaFold Búsqueda + redes + refuerzo; atención 03-03, 04-02, 05-04, 05-05 1 (problema medible), 2 (datos existentes) Combinar técnicas; medida clara; los datos acumulados durante décadas son el activo Rutas (caso 5) con tiempos aprendidos; guardar bien los datos desde hoy
Selección y scoring con sesgo Clasificación supervisada sobre decisiones humanas 02-03, 02-04, 04-02 1 (restricciones), 2 (etiqueta), 7 (equidad) La etiqueta hereda el sesgo; quitar la columna no basta; elegir la definición de equidad Predictor (caso 3): paridad entre zonas en la model card y en el calendario
Asistentes con LLM LLM + RAG + reglas de validación 05-05, 06-04 6 (alcance, human-in-the-loop), 7 (muestreo) La alucinación es una propiedad; la empresa responde por su chatbot Asistente (caso 7): solo con fuentes, sin promesas, derivación a persona
Watson for Oncology / reconocimiento facial Sistema experto + PLN; CNN de rostros 06-02, 05-04, 01-01, 02-04 2 (datos no representativos), 5 (validación externa), 1 (expectativas) Datos hipotéticos o de un solo grupo; sobreexpectativa; a veces no desplegar Diagnóstico (caso 9): validar por almacén, prometer poco, registrar correcciones; biometría, no

Errores Comunes y Consejos

  • Leer los casos como titulares. "La IA supera a los médicos" y "el algoritmo racista" esconden fases concretas que fallaron o funcionaron; busca siempre la métrica, los datos y el despliegue.
  • Tomar las cifras de comunicados como resultados. Distingue lo publicado con revisión por pares o auditoría de lo anunciado por la empresa interesada.
  • Creer que el sesgo se elimina quitando una columna. El ejemplo de la sección 8 lo desmiente en cinco líneas; mide por grupo siempre.
  • Pensar que los fracasos son de "otros" o de "otra época". Watson y el chatbot de la aerolínea son historias de sobreexpectativa y de alcance mal acotado; se repiten cada año con tecnología nueva.
  • Copiar la técnica sin copiar el contexto. AlphaFold funcionó porque había décadas de datos públicos y una métrica ciega; sin eso, la misma arquitectura no sirve.
  • Consejo: cuando te propongan un proyecto, busca el caso público más parecido y lee cómo acabó; después escribe el documento de definición de 08-01 con esa historia delante.

Ejercicios

Ejercicio 1: ficha de un caso nuevo

Elige un caso público de IA que no esté en esta lección (por ejemplo, un sistema de detección de fraude bancario, un vehículo autónomo, un sistema de ayudas sociales que generó reclamaciones, o un modelo de predicción de demanda en una cadena de distribución) y rellena la plantilla de la sección 1: contexto, problema, técnica (con la lección del curso), resultado, lecciones y paralelo en NovaMarket. Señala explícitamente qué partes de tu ficha son de dominio público y cuáles son suposiciones tuyas.

Ejercicio 2: el asistente que promete

Un cliente pregunta al asistente de NovaMarket: "¿Puedo devolver la cafetera NovaBrew a los 45 días si no me gusta?". La política real es de 30 días. Describe cómo debería estar diseñado el asistente (RAG, reglas de validación, derivación) para que no pueda contestar "sí", qué se registra de esa conversación y qué punto del calendario de monitorización de 08-01 detectaría un fallo si ocurriera. Relaciónalo con el caso 5.

Ejercicio 3: reparar el sesgo del ejemplo

Con el código de la sección 8, prueba dos "reparaciones" y mide el ratio de impacto en cada una: (a) entrenar sin palabra_proxy (solo con experiencia); (b) mantener las dos características pero fijar el umbral de recomendación por grupo de forma que las tasas se igualen. Discute qué problema tiene cada solución y por qué ninguna sustituye a la pregunta sobre la etiqueta.

Soluciones

Solución 1. No hay una respuesta única; el criterio es que la ficha separe hechos de suposiciones y enlace cada elemento con el curso. Ejemplo con un sistema de ayudas sociales que generó reclamaciones: contexto: una administración automatizó la detección de fraude en prestaciones; problema: clasificar solicitudes como sospechosas (04-02); técnica: modelo supervisado con historial y datos demográficos, en el que la nacionalidad o el código postal actuaron como proxies (02-04); resultado: miles de familias señaladas injustamente, dimisiones políticas y sanciones (de dominio público en el caso más conocido, aunque los detalles técnicos del modelo se conocen solo parcialmente); lecciones: etiqueta sesgada, alto riesgo sin revisión humana real, ausencia de derecho a explicación; paralelo: el predictor de devoluciones nunca deniega ni penaliza automáticamente y mide paridad entre zonas.

Solución 2. Diseño: el asistente responde con RAG sobre la política de devoluciones (05-05); el fragmento recuperado dice "30 días", así que la respuesta generada debería ser "no, el plazo es de 30 días", citando el fragmento. Como la generación puede fallar, una regla de validación (06-04) detecta que la respuesta contiene un plazo ("45 días") y comprueba que aparezca en el fragmento recuperado; si no aparece, sustituye la respuesta por la política literal o deriva a una persona. Además, cualquier respuesta que suponga una excepción o promesa ("sí puedes", "te lo reembolsamos") se bloquea y crea un ticket para atención al cliente. Se registra la pregunta, los fragmentos recuperados, la respuesta generada, la validación aplicada y la respuesta final, con identificador de conversación. Lo detectaría el muestreo semanal de conversaciones revisadas por atención al cliente (fila añadida al calendario en la sección 6), y antes aún las pruebas adversarias previas al despliegue. Es el caso 5 en pequeño: si el asistente hubiera dicho "sí", NovaMarket tendría que honrarlo.

Solución 3. (a) Sin palabra_proxy, el modelo solo usa la experiencia. En este conjunto ficticio la experiencia se reparte igual entre grupos, así que las tasas de recomendación se acercan y el ratio de impacto sube claramente (en el entorno del curso: 30,7 % de hombres y 36,4 % de mujeres recomendados, ratio 0,84, por encima de 0,8; el pequeño desequilibrio a favor del otro grupo es azar de la generación). Problema: en un caso real siempre quedan otros proxies (nombre del centro de estudios, huecos en el CV, aficiones) y no se pueden quitar todos; además, si en el histórico las mujeres con la misma experiencia se contrataban menos, la etiqueta sigue sesgada aunque las características sean neutras. (b) Umbrales por grupo: se elige, para cada grupo, el umbral de probabilidad que produce la misma tasa de recomendación (por ejemplo, la del grupo más favorecido); el ratio de impacto pasa a valer 1 por construcción. Problema: se está usando explícitamente la característica protegida para decidir (algo que en muchos ámbitos exige justificación legal y en otros está prohibido), y se iguala una métrica (paridad de tasas) a costa de otras (calibración, tasas de error), el dilema de COMPAS. Ninguna de las dos toca la pregunta de fondo: si contratado_historico refleja decisiones sesgadas, el modelo está aprendiendo a reproducirlas; la reparación real empieza por decidir qué etiqueta es aceptable como verdad (por ejemplo, rendimiento posterior de los contratados, o evaluaciones ciegas), qué definición de equidad se adopta y qué papel tiene la revisión humana.

Conclusión

Seis casos, seis lecciones que ya conocíamos en teoría y que aquí tienen nombre y factura. Del Netflix Prize y los recomendadores: la métrica del concurso no es la del negocio, la complejidad se paga en producción y anonimizar es difícil. Del diagnóstico por imagen: los modelos brillan en el laboratorio y tropiezan al cambiar de hospital, de cámara o de tono de piel, y el flujo de trabajo decide tanto como el AUC. De AlphaGo y AlphaFold: combinar búsqueda, redes y refuerzo sobre problemas medibles y con datos acumulados durante décadas produce impacto científico real, y aun así es IA estrecha. De la selección con sesgo y COMPAS: la etiqueta hereda el pasado, quitar la columna no basta, hay que medir por grupo y elegir la definición de equidad (lo hemos reproducido en cinco líneas: ratio de impacto 0,56 sin ver el género). Del chatbot de la aerolínea: la alucinación es una propiedad, la empresa responde por lo que dice su asistente, y RAG con validación y derivación humana es el diseño mínimo. De Watson for Oncology y el reconocimiento facial: datos que no representan la realidad de uso, sobreexpectativa y ausencia de validación externa hunden proyectos, y a veces la decisión correcta es no desplegar. Y para NovaMarket, cada caso ha dejado una decisión concreta en el recomendador, el clasificador de fotos, las rutas, el predictor, el asistente y el diagnóstico de incidencias.

Con el método (08-01) y la experiencia ajena (08-02), queda mirar hacia delante: qué está cambiando en la IA ahora mismo, qué es sólido y qué es especulación, y qué debe preparar un profesional junior y una empresa como NovaMarket. Es la última lección del módulo, 08-03, Tendencias Futuras en IA.

Fundamentos de Inteligencia Artificial (IA)

Módulo 1: Introducción a la Inteligencia Artificial

Módulo 2: Principios Básicos de la IA

Módulo 3: Algoritmos en IA

Módulo 4: Aprendizaje Automático (Machine Learning)

Módulo 5: Redes Neuronales y Deep Learning

Módulo 6: Lógica y Sistemas Expertos

Módulo 7: Herramientas y Lenguajes de Programación en IA

Módulo 8: Proyectos y Casos de Estudio

Módulo 9: Ejercicios y Prácticas

Módulo 10: Recursos Adicionales

© Copyright 2026. Todos los derechos reservados