Con la media y la desviación típica ya describes el centro y la anchura de tus datos. Pero Marta rara vez pregunta por "los datos en general"; pregunta por casos concretos: «¿Un pedido que tardó 36 horas es normal o es una incidencia?», «¿Este socio está entre los que más gastan?», «¿Ese ticket de 3.240 € es real o alguien tecleó mal?». Para responder necesitas saber dónde cae un valor dentro del conjunto: eso hacen las medidas de posición (cuartiles, deciles, percentiles y puntuaciones z) y, con ellas, las reglas para detectar valores atípicos. En esta lección aprenderás a calcularlas, a leer un diagrama de caja y, sobre todo, a decidir qué hacer cuando aparece un dato sospechoso —una decisión que conecta directamente con la calidad de datos que viste en Tipos de Datos.

Contenido

  1. La idea de posición relativa
  2. Cuartiles
  3. Deciles y percentiles
  4. El rango intercuartílico (IQR)
  5. El diagrama de caja (boxplot)
  6. Detección de atípicos: la regla 1,5×IQR
  7. Puntuaciones z: posición en unidades de desviación típica
  8. ¿Qué hago con un atípico?

La idea de posición relativa

Un dato aislado no dice casi nada: ¿36 horas de entrega es mucho? Depende de cómo se reparten las demás entregas. Las medidas de posición responden ordenando los datos de menor a mayor y localizando puntos de corte que dividen el conjunto en partes con el mismo número de observaciones:

Medida Divide los datos en… Puntos de corte
Mediana 2 mitades 1 (el 50 %)
Cuartiles 4 cuartos 3 (Q1, Q2, Q3)
Deciles 10 décimas partes 9 (D1 … D9)
Percentiles 100 centésimas 99 (P1 … P99)

Todas son la misma idea con distinta resolución: la mediana es Q2, que es D5, que es P50. Como se basan en el orden y no en los valores de los extremos, son medidas robustas, igual que la mediana.

El material de trabajo: 12 entregas del e-commerce

Logística te pasa los tiempos de entrega (en horas, desde el pedido hasta la puerta del cliente) de 12 pedidos de la semana pasada, ya ordenados:

\[ 18 \quad 20 \quad 21 \quad 22 \quad 24 \quad 25 \quad 26 \quad 28 \quad 30 \quad 33 \quad 36 \quad 72 \]

El pedido de 72 horas llama la atención de inmediato (un cliente estuvo tres días esperando). Trabajaremos toda la lección con esta muestra.

Cuartiles

Los cuartiles dividen los datos ordenados en cuatro partes iguales:

  • Q1 (primer cuartil): deja por debajo el 25 % de los datos.
  • Q2 (segundo cuartil): la mediana; deja por debajo el 50 %.
  • Q3 (tercer cuartil): deja por debajo el 75 %.

Usaremos el método de la posición interpolada: el cuartil \( k \) está en la posición

\[ \text{posición de } Q_k = \frac{k , (n+1)}{4} \]

y si la posición no es entera, se interpola entre los dos valores vecinos. (Aviso honesto: existen varias convenciones de cálculo y las hojas de cálculo pueden dar resultados ligeramente distintos entre sí; con muestras grandes las diferencias son irrelevantes.)

Cálculo paso a paso con las 12 entregas (( n = 12 ))

Q1: posición \( \frac{1 \times 13}{4} = 3{,}25 \) → está un 25 % del camino entre el 3.er valor (21) y el 4.º (22):

\[ Q_1 = 21 + 0{,}25 \times (22 - 21) = 21{,}25 \text{ horas} \]

Q2 (mediana): posición \( \frac{2 \times 13}{4} = 6{,}5 \) → a mitad de camino entre el 6.º valor (25) y el 7.º (26):

\[ Q_2 = \frac{25 + 26}{2} = 25{,}5 \text{ horas} \]

Q3: posición \( \frac{3 \times 13}{4} = 9{,}75 \) → un 75 % del camino entre el 9.º valor (30) y el 10.º (33):

\[ Q_3 = 30 + 0{,}75 \times (33 - 30) = 32{,}25 \text{ horas} \]

Lectura de negocio: el 25 % de los pedidos llega en menos de ~21 h; la mitad, en menos de 25,5 h; el 75 %, en menos de ~32 h. Ya puedes contestar a Marta: un pedido de 36 horas está por encima de Q3 —entre el 25 % más lento— pero dentro de lo que ocurre cada semana. El de 72 horas es otra historia, como veremos.

Deciles y percentiles

Los deciles y percentiles afinan la misma idea. El percentil \( P_k \) es el valor que deja por debajo el \( k,% \) de los datos; su posición interpolada es \( \frac{k,(n+1)}{100} \). Por ejemplo, con las entregas, \( P_{10} \): posición \( 0{,}10 \times 13 = 1{,}3 \) → \( 18 + 0{,}3 \times (20-18) = 18{,}6 \) horas: solo el 10 % de los pedidos llega antes de ~18,6 h.

Los percentiles son omnipresentes en la gestión:

  • Compromisos de servicio (SLA): logística de NovaMarket no promete "entrega media de 26 h" sino «el 90 % de los pedidos en menos de 48 h», es decir, un compromiso sobre el P90. La media no protege al cliente que cae en la cola lenta; el percentil sí.
  • Segmentación de clientes: el equipo de fidelización clasifica a los ≈380.000 socios del Club Nova por su gasto anual usando deciles:
Decil Gasto anual (límite superior) Lectura
D1 120 € El 10 % que menos gasta no llega a 120 €/año
D2 210 €
D3 310 €
D4 430 €
D5 580 € Gasto mediano: la mitad de los socios gasta menos de 580 €
D6 760 €
D7 990 €
D8 1.320 €
D9 1.980 € El 10 % superior gasta más de 1.980 €/año

Fíjate en la asimetría: de D1 a D2 hay 90 €, pero de D8 a D9 hay 660 €. Los deciles dibujan la forma de la distribución sin necesidad de gráfico: cola larga hacia los gastos altos, como corresponde a importes.

  • Posición individual: decirle a un socio (o a un gestor) «este cliente está en el percentil 92 de gasto» es más informativo que «gasta 2.300 €».

El rango intercuartílico (IQR)

El rango intercuartílico es la anchura del "50 % central" de los datos:

\[ IQR = Q_3 - Q_1 \]

Con las entregas: \( IQR = 32{,}25 - 21{,}25 = 11 \) horas. La mitad central de los pedidos cabe en una ventana de 11 horas.

El IQR es la alternativa robusta a la desviación típica, igual que la mediana lo es a la media: como ignora el 25 % inferior y el 25 % superior, los valores extremos no lo alteran. Compruébalo: si el pedido de 72 h hubiera tardado 172 h, la desviación típica de la muestra se dispararía, pero Q1, Q3 y el IQR no se moverían ni una décima. Por eso el IQR es la base de la regla estándar de detección de atípicos que veremos enseguida.

Resumen de parejas centro–dispersión:

Enfoque Centro Dispersión Cuándo conviene
Clásico Media \( \bar{x} \) Desviación típica \( s \) Datos sin extremos problemáticos; cálculos posteriores
Robusto Mediana IQR Datos asimétricos o con atípicos; descripción honesta

El diagrama de caja (boxplot)

El diagrama de caja (boxplot) es la representación gráfica de todo lo anterior en un solo dibujo. Se construye así:

  1. Una caja que va de Q1 a Q3 (su longitud es el IQR).
  2. Una línea dentro de la caja en la mediana.
  3. Bigotes: líneas que se extienden desde la caja hasta el dato más extremo que no sea atípico (según la regla 1,5×IQR del apartado siguiente).
  4. Puntos individuales más allá de los bigotes: los atípicos, dibujados uno a uno.

Para nuestras entregas, el resumen que el boxplot representa es:

Elemento Valor
Mínimo (no atípico) 18 h
Q1 (inicio de la caja) 21,25 h
Mediana (línea central) 25,5 h
Q3 (fin de la caja) 32,25 h
Máximo no atípico (fin del bigote) 36 h
Atípicos (puntos sueltos) 72 h

Cómo se lee:

  • Posición de la caja → dónde vive el 50 % central.
  • Longitud de la caja → dispersión (IQR).
  • Mediana descentrada dentro de la caja y bigotes desiguales → asimetría. En nuestras entregas, el bigote y los datos superiores se estiran mucho más que los inferiores: asimetría hacia la derecha (cola de pedidos lentos).
  • Puntos sueltos → candidatos a investigar.

Su gran virtud es la comparación: alineando un boxplot por tienda (o por mes, o por operador logístico) se comparan de un vistazo centros, dispersiones y atípicos de muchos grupos. Lo explotaremos en la próxima lección, Representación Gráfica de Datos.

Detección de atípicos: la regla 1,5×IQR

Un valor atípico (outlier) es una observación anormalmente alejada del resto. "Anormalmente" necesita una definición operativa, y la convención más extendida (propuesta por John Tukey, el inventor del boxplot) usa el IQR. Se calculan dos vallas:

\[ \text{Valla inferior} = Q_1 - 1{,}5 \times IQR \qquad \qquad \text{Valla superior} = Q_3 + 1{,}5 \times IQR \]

Todo dato fuera de las vallas se marca como atípico.

Aplicación a las 12 entregas

\[ 1{,}5 \times IQR = 1{,}5 \times 11 = 16{,}5 \] \[ \text{Valla inferior} = 21{,}25 - 16{,}5 = 4{,}75 \text{ h} \qquad \text{Valla superior} = 32{,}25 + 16{,}5 = 48{,}75 \text{ h} \]

Ningún pedido baja de 4,75 h (el mínimo es 18), pero 72 h > 48,75 h: el pedido de 72 horas es un atípico formal, no solo una impresión. Los bigotes del boxplot llegan hasta 18 y 36 (los datos más extremos dentro de las vallas), y el 72 se dibuja como punto aislado.

Observa el efecto sobre los resúmenes clásicos: la media de las 12 entregas es \( 355/12 \approx 29{,}6 \) h, pero sin el atípico baja a \( 283/11 \approx 25{,}7 \) h, mucho más cerca de la mediana (25,5 h). Un solo pedido movía la media casi 4 horas.

Dos matices importantes:

  • La regla es un detector de candidatos, no un juez: marca datos "a investigar", no datos "a borrar".
  • En distribuciones naturalmente asimétricas (importes, tiempos) es normal que aparezcan algunos atípicos legítimos por el lado largo; con muestras grandes, unos pocos puntos fuera de las vallas no son ninguna alarma.

Puntuaciones z: posición en unidades de desviación típica

Las medidas anteriores sitúan un dato por su orden. La puntuación z (o valor tipificado) lo sitúa por su distancia a la media, medida en desviaciones típicas:

\[ z = \frac{x - \bar{x}}{s} \]

  • \( z = 0 \): el dato coincide con la media.
  • \( z = +1 \): está una desviación típica por encima de la media.
  • \( z = -2 \): dos desviaciones típicas por debajo.

Su gran utilidad es que elimina las unidades: permite comparar posiciones relativas entre variables de escalas completamente distintas.

Ejemplo: ¿qué fue más excepcional?

El mismo día ocurren dos cosas: un cliente paga un ticket de 95 € y la tienda Madrid-Chamberí factura 60.000 €. ¿Cuál de los dos hechos es más extraordinario en su contexto? Con las cifras de referencia de NovaMarket:

Hecho Valor \( x \) Media \( \bar{x} \) Desv. típica \( s \) Puntuación z
Ticket de 95 € 95 32,40 € 21,50 € \( z = \frac{95 - 32{,}40}{21{,}50} \approx +2{,}91 \)
Día de 60.000 € 60.000 43.983 € 6.200 € \( z = \frac{60.000 - 43.983}{6.200} \approx +2{,}58 \)

Aunque 60.000 € "suena" mucho más grande que 95 €, el ticket es más excepcional dentro de su mundo: está casi 3 desviaciones típicas por encima de su media, frente a 2,6 del día de ventas. Las puntuaciones z funcionan como una moneda común de "rareza".

Un ejemplo con signo negativo: un socio puntúa la satisfacción con un 5. Con media 8,1 y desviación típica 1,6: \( z = (5 - 8{,}1)/1{,}6 \approx -1{,}94 \). Está casi dos desviaciones por debajo del socio medio: un descontento claro al que atención al cliente quizá deba llamar.

Como criterio orientativo, valores con \( |z| > 3 \) suelen tratarse también como candidatos a atípicos. De momento úsalo solo como regla de posición relativa: qué proporción de datos cabe esperar más allá de cada valor de z es algo que depende de la forma de la distribución y que podrás precisar cuando estudies la Distribución Normal. Ten en cuenta además que \( \bar{x} \) y \( s \) no son robustas: en muestras pequeñas con extremos, la regla del IQR es más fiable que la de las z.

¿Qué hago con un atípico?

Detectar el atípico es la parte fácil; decidir qué hacer con él es donde te juegas la calidad del análisis. El protocolo profesional tiene tres pasos:

1. Investigar el origen. Vuelve a la fuente (el sistema de tickets, el registro del pedido, el cuestionario) y pregunta: ¿es un error de registro o un valor real?

Diagnóstico Ejemplo NovaMarket Acción
Error de registro Un ticket de 3.240,00 € que resulta ser uno de 32,40 € con la coma decimal mal tecleada; una entrega con fecha de pedido posterior a la de entrega Corregir si conoces el valor verdadero; si no, tratarlo como dato perdido. Documentarlo siempre
Valor real pero ajeno a la población de interés El ticket de 289 € del bar: es real, pero si tu análisis es sobre hogares, ese cliente mayorista no pertenece a la población definida Excluirlo del análisis, declarándolo: redefines el alcance, no "limpias"
Valor real y pertinente El pedido de 72 h: hubo una avería en el reparto de esa ruta Conservarlo. Es información valiosísima: los atípicos reales son a menudo el hallazgo (fraude, averías, clientes excepcionales)

2. Analizar con y sin él cuando haya dudas. Si la conclusión de negocio cambia según incluyas o no el atípico, tu resultado es frágil y debes decirlo. Si no cambia, mejor: repórtalo con el dato incluido.

3. Documentar la decisión. En el informe (y en el diccionario de datos que montaste en Tipos de Datos): qué detectaste, qué decidiste y por qué. Nunca borres datos en silencio: un análisis donde los atípicos desaparecen sin explicación no es reproducible ni honesto.

La regla de oro: un atípico se investiga; solo se corrige si es un error demostrado, y solo se excluye si no pertenece a la población que estudias.

Errores Comunes y Consejos

  • Olvidar ordenar los datos antes de buscar cuartiles o percentiles. Es el fallo número uno; toda medida de posición presupone datos ordenados.
  • Alarmarse porque la hoja de cálculo da otro cuartil. Hay varias convenciones de interpolación legítimas; documenta cuál usas y no mezcles métodos al comparar.
  • Confundir el percentil con el valor. «Estar en el P90 de gasto» no significa gastar 90 € ni gastar un 90 % más: significa gastar más que el 90 % de los socios.
  • Borrar atípicos automáticamente (o, al revés, no mirar nunca los extremos). Ambos destruyen información: la regla 1,5×IQR marca candidatos a investigar, no una lista de eliminación.
  • Usar puntuaciones z con datos muy asimétricos o muestras pequeñas como único criterio: media y desviación típica están contaminadas justo por los valores que intentas juzgar. Prefiere el IQR en esos casos.
  • Consejo: acostúmbrate a pedir (o construir) el resumen de cinco números —mínimo, Q1, mediana, Q3, máximo— de toda variable nueva que te llegue. Son cinco cifras y cuentan la forma completa de la distribución.

Ejercicios

Ejercicio 3.1: cuartiles, IQR y vallas

Once importes de ticket de la tienda Barcelona-Gràcia, ya ordenados (en euros): 9,80 — 14,20 — 19,60 — 22,10 — 25,40 — 28,90 — 33,50 — 38,70 — 44,20 — 51,80 — 120,00.

  1. Calcula Q1, Q2 y Q3 con el método de la posición \( k(n+1)/4 \).
  2. Calcula el IQR y las vallas de la regla 1,5×IQR. ¿Hay atípicos?
  3. Describe cómo sería el boxplot (extremos de la caja, mediana, bigotes, puntos sueltos).

Ejercicio 3.2: comparar con puntuaciones z

Un día concreto, la tienda de Cuenca factura 39.500 € y Sevilla-Nervión factura 52.000 €. Usando la media (43.983 €) y la desviación típica (6.200 €) de las ventas diarias de la cadena:

  1. Calcula la puntuación z de cada tienda ese día.
  2. Interpreta los signos y magnitudes. ¿Alguno de los dos días es "excepcional" según el criterio orientativo \( |z| > 3 \)?

Ejercicio 3.3: decidir qué hacer

En el fichero de la encuesta de satisfacción encuentras tres casos: (a) un socio con edad registrada de 141 años; (b) un socio con gasto anual de 9.400 € que, comprobado, es el dueño de un restaurante que hace sus compras en NovaMarket; (c) una satisfacción de 0 de un cliente que escribió un comentario furioso sobre una entrega perdida. Tu análisis busca describir la satisfacción de los hogares socios del Club Nova. ¿Qué harías con cada caso?

Soluciones

Ejercicio 3.1:

  1. \( n = 11 \), así que \( n+1 = 12 \) y las posiciones son enteras: Q1 en la posición 3 → 19,60 €; Q2 en la posición 6 → 28,90 €; Q3 en la posición 9 → 44,20 €.
  2. \( IQR = 44{,}20 - 19{,}60 = 24{,}60 \) €. \( 1{,}5 \times IQR = 36{,}90 \). Vallas: \( 19{,}60 - 36{,}90 = -17{,}30 \) € y \( 44{,}20 + 36{,}90 = 81{,}10 \) €. El ticket de 120,00 € es atípico (supera la valla superior); no hay atípicos inferiores (una valla negativa es normal y simplemente inalcanzable con importes). Error frecuente: usar el máximo y el mínimo reales como bigotes aunque haya atípicos.
  3. Caja de 19,60 a 44,20 con la mediana en 28,90 (descentrada hacia abajo: asimetría a la derecha); bigote inferior hasta 9,80 (mínimo, dentro de vallas) y superior hasta 51,80 (mayor dato ≤ 81,10); un punto aislado en 120,00.

Ejercicio 3.2:

  1. Cuenca: \( z = (39.500 - 43.983)/6.200 \approx -0{,}72 \). Sevilla-Nervión: \( z = (52.000 - 43.983)/6.200 \approx +1{,}29 \).
  2. Cuenca está algo por debajo de la media de la cadena (menos de una desviación típica: un día flojo pero corriente); Sevilla, claramente por encima pero sin llegar a raro. Ninguno supera \( |z| > 3 \): no hay nada excepcional que investigar. Error frecuente: comparar los euros directamente (52.000 frente a 39.500) sin tipificar; ojo también con usar la media de la cadena si lo que quieres es comparar cada tienda con su propio histórico, que sería otra pregunta (y otras \( \bar{x} \) y \( s \)).

Ejercicio 3.3:

(a) Error de registro evidente (nadie tiene 141 años): intenta recuperar el valor real (¿un 41?); si no es posible, márcalo como perdido. Documéntalo. (b) Valor real pero fuera de la población definida (hogares): exclúyelo del análisis declarándolo en el informe; no es "limpieza", es definición de alcance. (c) Valor real y pertinente: consérvalo; ese 0 con su comentario es probablemente el dato más accionable de la encuesta para logística. Error frecuente: tratar los tres casos igual (borrarlos "por ser raros"); cada atípico exige su propio diagnóstico.

Conclusión

Ya dominas la caja de herramientas descriptiva completa: a la media y la desviación típica has añadido cuartiles, deciles y percentiles para localizar cualquier dato por su orden, el IQR como dispersión robusta, el boxplot como resumen visual de cinco números, la regla 1,5×IQR para señalar candidatos a atípicos, las puntuaciones z para comparar rarezas entre escalas distintas y, lo más importante, un protocolo para decidir —investigando, no borrando— qué hacer con cada dato anómalo.

Hasta ahora todos estos resúmenes han sido numéricos. Pero cuando Marta entre en el comité de dirección no proyectará tablas de cuartiles: proyectará gráficos, y de que estén bien elegidos y bien construidos dependerá que la sala entienda —o malinterprete— los datos. Elegir el gráfico adecuado para cada tipo de variable, leer la forma de una distribución y esquivar los gráficos engañosos es el tema de la próxima lección: Representación Gráfica de Datos.

© Copyright 2026. Todos los derechos reservados