Marta presenta el mes que viene los resultados de la encuesta de satisfacción al comité de dirección, y te encarga los materiales: «Nadie en esa sala va a leer una tabla de cuartiles. Quiero gráficos que se entiendan en cinco segundos y que no engañen a nadie». Esta lección cierra el módulo enseñándote justo eso: cómo organizar los datos en tablas de frecuencias (el esqueleto de todo gráfico), qué gráfico corresponde a cada tipo de variable, cómo leer la forma de una distribución sobre un histograma y cómo reconocer —y no cometer— los trucos de los gráficos engañosos. Un buen gráfico es el puente entre tu análisis y la decisión; uno malo puede provocar la decisión equivocada con datos correctos.

Contenido

  1. Tablas de frecuencias: absolutas, relativas y acumuladas
  2. Agrupación en intervalos
  3. Qué gráfico para qué variable
  4. Gráficos para variables categóricas: barras y sectores
  5. Gráficos para variables cuantitativas: histograma y polígono de frecuencias
  6. La forma de la distribución
  7. Comparar y relacionar: boxplot comparativo, líneas y dispersión
  8. Buenas prácticas y gráficos engañosos

Tablas de frecuencias: absolutas, relativas y acumuladas

Antes del gráfico está la tabla de frecuencias: el recuento organizado de cuántas veces aparece cada valor. Tres columnas la componen:

  • Frecuencia absoluta (\( n_i \)): número de observaciones con ese valor.
  • Frecuencia relativa (\( f_i = n_i / n \)): proporción o porcentaje sobre el total. Imprescindible para comparar grupos de distinto tamaño.
  • Frecuencias acumuladas (\( N_i \), \( F_i \)): suma de las frecuencias hasta ese valor inclusive. Solo tienen sentido si los valores se pueden ordenar (variables ordinales o cuantitativas).

Ejemplo: las 640 respuestas de satisfacción

Por fin procesas la encuesta completa. La distribución de la nota de satisfacción (0–10):

Nota Frec. absoluta \( n_i \) Frec. relativa \( f_i \) (%) Frec. abs. acumulada \( N_i \) Frec. rel. acumulada \( F_i \) (%)
0 2 0,3 2 0,3
1 2 0,3 4 0,6
2 4 0,6 8 1,3
3 6 0,9 14 2,2
4 10 1,6 24 3,8
5 24 3,8 48 7,5
6 40 6,3 88 13,8
7 96 15,0 184 28,8
8 150 23,4 334 52,2
9 170 26,6 504 78,8
10 136 21,3 640 100,0
Total 640 100

(Los porcentajes están redondeados a un decimal; por eso alguna suma parcial puede descuadrar una décima.)

Esta tabla ya responde preguntas de negocio sin ningún gráfico:

  • Moda: 9 (170 respuestas, el 26,6 %).
  • Mediana: la acumulada cruza el 50 % en la nota 8 (\( F_8 = 52{,}2,% \)) → mediana 8. Coherente con lo aprendido: la media (8,1) queda por debajo de la moda y muy cerca de la mediana, con la cola de notas bajas tirando de ella.
  • Lectura acumulada: solo el 7,5 % puntúa 5 o menos; el 71,2 % (100 − 28,8) puntúa 8 o más. En gestión de satisfacción, estas acumuladas ("% de detractores", "% de promotores") son a menudo el indicador que se sigue, más que la media.

Agrupación en intervalos

Con variables continuas (importes, tiempos) casi ningún valor se repite y la tabla anterior no funciona: hay que agrupar en intervalos (o clases).

Ejemplo: 200 tickets de un sábado en Valencia-Ruzafa

Importe del ticket (€) \( n_i \) \( f_i \) (%) \( F_i \) (%)
[0 – 15) 28 14 14
[15 – 30) 64 32 46
[30 – 45) 52 26 72
[45 – 60) 30 15 87
[60 – 75) 16 8 95
[75 – 90) 8 4 99
[90 – 105) 2 1 100
Total 200 100

La notación [15 – 30) significa "desde 15 incluido hasta 30 sin incluir": así cada ticket cae en un único intervalo, sin ambigüedad en las fronteras.

Criterios prácticos de agrupación:

  • Número de intervalos: entre 5 y 15 suele funcionar; una referencia habitual es la regla de Sturges, \( k \approx 1 + 3{,}3 \cdot \log_{10}(n) \) (con \( n = 200 \), \( k \approx 8{,}6 \) → unos 7-9 intervalos). Pocos intervalos esconden la forma; demasiados la fragmentan en ruido.
  • Anchura constante siempre que sea posible (aquí, 15 €): los intervalos de anchura desigual complican la lectura y son fuente clásica de gráficos engañosos.
  • Límites "redondos" (0, 15, 30…) que el lector procese sin esfuerzo.
  • Se pierde detalle al agrupar (es el precio de la claridad): calcula las medidas exactas (media, cuartiles) sobre los datos originales, no sobre la tabla agrupada, si los tienes.

Qué gráfico para qué variable

La primera decisión gráfica no es estética: depende del tipo de variable (repasa Tipos de Datos) y de la pregunta que quieres responder.

Quiero mostrar… Tipo de datos Gráfico adecuado
Cuántos hay de cada categoría Nominal / ordinal Barras
Cómo se reparte un total (pocas partes) Nominal, partes de un todo Sectores (tarta)
La distribución de una variable continua Cuantitativa continua Histograma (o polígono de frecuencias)
Comparar la distribución entre varios grupos Continua + grupos Boxplots comparativos
La evolución en el tiempo Serie temporal Líneas
La relación entre dos cuantitativas Dos continuas Dispersión (nube de puntos)

Como regla de decisión rápida:

flowchart TD
    A[¿Qué quiero mostrar?] --> B{¿La variable es categórica?}
    B -- Sí --> C{¿Partes de un todo y pocas categorías?}
    C -- Sí --> D[Sectores]
    C -- No --> E[Barras]
    B -- No --> F{¿Interviene el tiempo?}
    F -- Sí --> G[Líneas]
    F -- No --> H{¿Una variable o dos?}
    H -- Una --> I[Histograma / boxplot]
    H -- Dos --> J[Dispersión]

Gráficos para variables categóricas: barras y sectores

Gráfico de barras

Una barra por categoría; la altura es la frecuencia (absoluta o relativa). Es el gráfico más seguro que existe: el ojo humano compara longitudes con mucha precisión.

Ejemplo: cuota de ventas por categoría de producto en NovaMarket, un gráfico de barras construido sobre esta tabla:

Categoría de producto % de las ventas
Alimentación fresca 38
Despensa y conservas 27
Bebidas 14
Droguería y perfumería 12
Otros 9

Buenas prácticas: barras desde cero siempre (la longitud es el dato); categorías nominales ordenadas de mayor a menor frecuencia (las ordinales, en su orden natural: nunca reordenes las notas 0–10 por frecuencia); barras separadas entre sí (el hueco distingue visualmente las barras del histograma, que va pegado).

Gráfico de sectores

La clásica "tarta": cada categoría es una porción proporcional a su frecuencia. Solo funciona si se cumplen tres condiciones: las partes suman un todo (100 %), hay pocas categorías (4-6 como máximo) y las diferencias son grandes. El reparto de las 640 respuestas por canal —tienda física 70 % (448), online 20 % (128), app 10 % (64)— es un buen candidato. La cuota de 15 categorías de producto, no: el ojo compara ángulos mucho peor que longitudes. Ante la duda, usa barras; nunca uses tartas para comparar valores parecidos entre sí.

Gráficos para variables cuantitativas: histograma y polígono de frecuencias

Histograma

El histograma es el gráfico de la tabla de intervalos: un rectángulo por intervalo, pegados entre sí (la variable es continua, no hay huecos), cuya área representa la frecuencia. Con intervalos de anchura constante, la altura es directamente la frecuencia; si alguna vez usas anchuras desiguales, debes representar densidad (frecuencia ÷ anchura) o distorsionarás el dibujo.

Sobre el histograma de los 200 tickets de Valencia-Ruzafa (tabla anterior) verías: una subida rápida hasta el intervalo [15 – 30), que es el intervalo modal (64 tickets), y una bajada progresiva con una cola larga hacia la derecha hasta los pocos tickets de 90-105 €. Un vistazo y ya conoces el negocio: muchas compras pequeñas y medianas, pocas compras grandes.

Polígono de frecuencias

El polígono de frecuencias une con líneas los puntos medios de la parte superior de cada barra del histograma (para los tickets: los puntos (7,5, 28), (22,5, 64), (37,5, 52)…). Aporta lo mismo que el histograma, pero como es una línea permite superponer varias distribuciones sin que se tapen: por ejemplo, la distribución de tickets de un sábado frente a la de un martes en la misma cuadrícula.

La forma de la distribución

El histograma no se mira: se lee. Tres preguntas guían la lectura:

1. ¿Es simétrica o asimétrica?

Forma Qué se ve Relación media–mediana Ejemplo NovaMarket
Simétrica Las dos mitades son casi espejo Media ≈ mediana Ventas diarias de una tienda estable
Asimétrica a la derecha (positiva) Cola larga hacia los valores altos Media > mediana Importes de ticket, gasto anual por socio, tiempos de entrega
Asimétrica a la izquierda (negativa) Cola larga hacia los valores bajos Media < mediana Notas de satisfacción (concentradas en 8-10 con cola de descontentos)

Aquí encajan todas las piezas del módulo: la satisfacción tiene media 8,1, mediana 8 y moda 9 —media por debajo, arrastrada por la cola izquierda de descontentos—, mientras que los tickets tienen la media por encima de la mediana por su cola derecha de compras grandes. La asimetría que diagnosticabas comparando media y mediana en Medidas de Tendencia Central, ahora la ves.

2. ¿Cuántos picos tiene? Una distribución unimodal tiene un solo pico; una bimodal, dos. La bimodalidad casi siempre delata dos poblaciones mezcladas: el histograma de afluencia de clientes por hora en Madrid-Centro tiene dos picos claros (12:00–14:00 y 18:00–20:00) porque mezcla dos tipos de visita —la compra de mediodía y la de después del trabajo—. Ante un histograma bimodal, la pregunta correcta no es «¿cuál es la media?» (caería en el valle, donde casi no hay datos) sino «¿qué dos grupos estoy mezclando y debo separar?».

3. ¿Hay valores aislados? Barras sueltas lejos del cuerpo principal: los candidatos a atípicos de la lección anterior, ahora visibles.

Comparar y relacionar: boxplot comparativo, líneas y dispersión

Boxplots comparativos

Para comparar una variable continua entre grupos, el histograma se queda corto (superponer más de dos es ilegible). La herramienta es el boxplot comparativo: las cajas de todos los grupos alineadas sobre el mismo eje. Por ejemplo, los tiempos de entrega del e-commerce por trimestre:

Trimestre Mín. Q1 Mediana Q3 Máx. no atípico Atípicos
T1 16 22 27 34 46 70, 72
T2 15 21 25,5 32 44 72
T3 14 19 22 27 38 61

Dibujadas las tres cajas una junto a otra, la historia se lee sola: en el T3 la mediana baja (entregas más rápidas), la caja se estrecha (más consistencia) y sigue habiendo algún atípico que investigar. Un solo gráfico, tres distribuciones comparadas en centro, dispersión, asimetría y atípicos: por eso el boxplot comparativo es uno de los gráficos favoritos de los analistas.

Gráfico de líneas temporal

Cuando el eje horizontal es el tiempo (días, meses, trimestres), el gráfico de líneas muestra la evolución: las ventas mensuales del e-commerce, la satisfacción media por oleada de encuesta. Puntos consecutivos unidos por segmentos; el ojo capta tendencias, estacionalidad (el pico de diciembre de NovaMarket) y rupturas. Dos normas: el eje temporal en orden cronológico con espaciado uniforme, y sin conectar puntos si hay huecos de datos. El análisis en profundidad de tendencias y estacionalidad tiene su propia lección de Series Temporales; aquí basta con saber presentar la evolución.

Gráfico de dispersión

El gráfico de dispersión (nube de puntos) muestra dos variables cuantitativas a la vez: cada observación es un punto con coordenadas (x, y). Ejemplo: superficie de sala frente a venta media diaria de ocho tiendas —Cuenca (850 m², 19.200 €), Bilbao-Casco (1.100 m², 44.000 €), Zaragoza-Centro (1.150 m², 44.000 €), Valencia-Ruzafa (1.200 m², 44.100 €), Barcelona-Gràcia (1.250 m², 46.100 €), Madrid-Chamberí (1.300 m², 47.500 €), Sevilla-Nervión (1.400 m², 52.300 €), Madrid-Centro (2.000 m², 68.400 €)—. Al dibujar la nube se aprecia un patrón claro: a más superficie, más venta. Cuantificar la fuerza de esa relación (y sus trampas) es el objeto del Análisis de Correlación; por ahora quédate con el gráfico como herramienta de presentación y primera exploración.

Buenas prácticas y gráficos engañosos

Un gráfico puede mentir sin contener ni un solo dato falso. Los trucos más frecuentes —que debes saber detectar como lector y evitar como autor:

1. El eje truncado. El clásico. Sevilla-Nervión vendió ayer 44.100 € y Zaragoza-Centro 43.900 €: una diferencia del 0,5 %. En un gráfico de barras cuyo eje empiece en 43.800 €, la barra de Sevilla se ve tres veces más alta; con el eje desde 0, ambas son visualmente idénticas (que es la verdad). Regla: las barras siempre desde cero, porque su longitud codifica el valor. En un gráfico de líneas sí se admite un eje recortado para ver detalle de la variación, pero indicándolo con claridad.

2. Áreas y pictogramas. Para mostrar que las ventas online se han duplicado, alguien dibuja un carrito el doble de alto… pero al escalar alto y ancho a la vez, el área se multiplica por 4 y el cerebro lee "×4". Con volúmenes 3D, ×8.

3. El 3D decorativo. Las tartas y barras en 3D con perspectiva distorsionan sistemáticamente: los sectores delanteros parecen mayores. El 3D no añade información; solo error.

4. La ventana temporal a conveniencia. «Las ventas crecen desde marzo» puede ser cierto y a la vez esconder que caen un 12 % interanual. Elegir el rango del eje temporal que favorece la conclusión deseada es cherry-picking. Muestra el contexto suficiente y compara con periodos homogéneos.

5. Intervalos de anchura desigual sin ajustar en un histograma: un intervalo el doble de ancho acumula más frecuencia y parece un pico artificial (por eso la altura debe ser densidad en ese caso).

6. Sobrecarga. Doce colores, doble eje vertical, etiquetas giradas, decimales infinitos. Cada elemento que no aporta información resta atención a la que sí.

Checklist del buen gráfico, antes de enviárselo a Marta:

  • Título que enuncia el mensaje («El T3 acorta y estabiliza las entregas»), no solo el contenido («Tiempos de entrega»).
  • Ejes rotulados con unidades; barras desde cero; fuente de los datos y \( n \) visibles.
  • El tipo de gráfico correcto para el tipo de variable (la tabla de la sección 3).
  • Orden con sentido (categorías por frecuencia, ordinales por su escala, tiempo cronológico).
  • ¿Se entiende en cinco segundos sin leer la letra pequeña? Si no, simplifica.

Errores Comunes y Consejos

  • Elegir el gráfico por estética y no por tipo de variable. Una tarta para 12 categorías o unas barras para una variable continua confunden aunque queden "bonitas".
  • Truncar el eje de un gráfico de barras para agrandar diferencias minúsculas. Es el error (o la trampa) más común en informes de empresa.
  • Confundir barras con histograma. Barras separadas para categorías; rectángulos pegados para intervalos de una variable continua. No es un capricho tipográfico: comunica si la variable es discreta/categórica o continua.
  • Ignorar la forma. Reportar solo la media de una distribución bimodal o muy asimétrica es describir un cliente que no existe; el histograma se mira antes de elegir los resúmenes numéricos.
  • Usar frecuencias absolutas para comparar grupos de tamaño distinto. 150 quejas del canal online frente a 90 de la app parecen peor para online… hasta ponerlas en porcentaje de sus pedidos. Compara con relativas.
  • Consejo: para cada gráfico que publiques, escribe primero en una frase el mensaje que debe transmitir; si el gráfico terminado no grita esa frase, cámbialo.

Ejercicios

Ejercicio 4.1: tabla de frecuencias y elección de gráfico

De 20 tickets de la tienda Madrid-Chamberí anotas la forma de pago: tarjeta, tarjeta, efectivo, app, tarjeta, efectivo, tarjeta, tarjeta, app, tarjeta, efectivo, tarjeta, tarjeta, app, efectivo, tarjeta, tarjeta, efectivo, tarjeta, app.

  1. Construye la tabla de frecuencias absolutas y relativas. ¿Tienen sentido las acumuladas?
  2. ¿Qué gráfico(s) usarías y en qué orden colocarías las categorías?

Ejercicio 4.2: leer la forma de una distribución

Tiempos de entrega de 400 pedidos del e-commerce, agrupados:

Tiempo (horas) \( n_i \)
[12 – 18) 36
[18 – 24) 128
[24 – 30) 124
[30 – 36) 64
[36 – 42) 28
[42 – 48) 12
[48 – 54) 8
  1. Calcula las frecuencias relativas y las relativas acumuladas.
  2. Describe la forma que tendría el histograma (picos, simetría). ¿Qué relación esperas entre media y mediana?
  3. Logística quiere prometer «entrega en menos de 36 h». ¿Qué porcentaje de pedidos cumple hoy esa promesa?

Ejercicio 4.3: auditoría de un gráfico engañoso

Un proveedor de software presenta este gráfico a Marta: barras 3D comparando la satisfacción media de clientes «con nuestra app» (8,3) y «sin ella» (8,0), con el eje vertical de 7,9 a 8,4, sin indicar cuántos clientes hay en cada grupo. Identifica al menos tres problemas y propón cómo debería rehacerse.

Soluciones

Ejercicio 4.1:

  1. Recuento: tarjeta 12 (60 %), efectivo 5 (25 %), app 4 (20 %)… ¡cuidado! 12 + 5 + 4 = 21 > 20: repasa el recuento. Correcto: tarjeta 11 (55 %), efectivo 5 (25 %), app 4 (20 %); total 20 y 100 %. (Este tropiezo es intencionado: verifica siempre que las frecuencias suman \( n \); es el control de calidad más básico de una tabla.) Las acumuladas no tienen sentido: la forma de pago es nominal, no hay orden que acumular.
  2. Barras (o sectores, que aquí es aceptable: 3 categorías que suman el todo), con las categorías ordenadas de mayor a menor frecuencia: tarjeta, efectivo, app. Nunca un histograma: no es una variable continua.

Ejercicio 4.2:

  1. Relativas (%): 9, 32, 31, 16, 7, 3, 2. Acumuladas (%): 9, 41, 72, 88, 95, 98, 100.
  2. Unimodal, con el pico en [18 – 24) —seguido de cerca por [24 – 30)— y asimétrica a la derecha: la cola se estira hacia las entregas lentas (hasta 54 h) mientras que por la izquierda el recorrido es corto. En consecuencia, cabe esperar media > mediana. Error frecuente: llamarla "asimétrica a la izquierda" porque el pico está a la izquierda; la asimetría se nombra por el lado de la cola, no del pico.
  3. Cumplen los pedidos por debajo de 36 h: la acumulada hasta [30 – 36) es el 88 %. Si el compromiso comercial exige un 90 %, hoy no se alcanza (por poco): dato accionable para logística.

Ejercicio 4.3:

Problemas: (1) eje truncado (7,9–8,4): agranda una diferencia de 0,3 puntos hasta hacerla parecer enorme —con barras, el eje debe empezar en 0—; (2) 3D decorativo que distorsiona la comparación; (3) falta el tamaño de los grupos (\( n \)): sin él no sabes si el 8,3 viene de 30 clientes o de 3.000; (4) además, los grupos "con app / sin app" pueden ser distintos en todo lo demás (los clientes que instalan la app son probablemente los más fieles), así que la diferencia no demuestra el efecto de la app —distinguir asociación de causalidad reaparecerá en el Módulo 6—. Rehacer: barras 2D desde 0 (donde se verá que 8,3 y 8,0 son casi iguales), indicando \( n \) de cada grupo y, mejor aún, mostrando la distribución completa de notas de cada grupo, no solo las medias.

Conclusión

Con esta lección cierras el Módulo 2 y tu caja de herramientas descriptiva está completa: tablas de frecuencias como esqueleto, el gráfico correcto para cada tipo de variable (barras y sectores para categorías; histograma, polígono y boxplot para continuas; líneas para el tiempo; dispersión para parejas de variables), la lectura de la forma —simetría, colas, número de picos— que da sentido a las medidas de los temas anteriores, y el ojo crítico para detectar ejes truncados, áreas infladas y demás trampas visuales. Marta ya tiene su presentación: satisfacción con mediana 8 y cola izquierda de descontentos, tickets con cola derecha, entregas que mejoran trimestre a trimestre.

Pero en el comité alguien hará la pregunta inevitable: «Ese 8,1 viene de 640 respuestas de 380.000 socios… ¿cuánto podemos fiarnos?». Para responderla no basta con describir: hay que medir la incertidumbre, y el lenguaje de la incertidumbre es la probabilidad. De eso trata el Módulo 3, que arranca con los Conceptos Básicos de Probabilidad: experimentos aleatorios, sucesos y las distintas maneras de asignar un número a la frase «es probable que».

© Copyright 2026. Todos los derechos reservados