Las pruebas t, el ANOVA o los intervalos de la regresión comparten una letra pequeña: suponen que los datos siguen (aproximadamente) una distribución conocida, casi siempre la normal, o que la muestra es lo bastante grande para que el Teorema Central del Límite acuda al rescate. Pero en el día a día de NovaMarket abundan las situaciones donde esa letra pequeña no se cumple: ocho valoraciones de un piloto, escalas de satisfacción del 0 al 10 que son ordinales más que numéricas, un tiempo de entrega disparatado que arrastra la media. Los métodos no paramétricos son la alternativa: pruebas que no exigen suponer una distribución concreta porque trabajan con rangos (posiciones ordenadas) en lugar de con los valores originales. En esta lección aprenderás cuándo recurrir a ellos, qué precio se paga, y las cuatro pruebas esenciales — signos, Wilcoxon, Mann-Whitney y Kruskal-Wallis — con cálculos a mano asumibles. Cierra el módulo con la tabla-guía que empareja cada prueba paramétrica con su alternativa.

Contenido

  1. Cuándo fallan los supuestos paramétricos
  2. Qué se gana y qué se pierde: el precio en potencia
  3. La prueba de los signos: la idea más simple
  4. Wilcoxon de rangos con signo: datos pareados
  5. Mann-Whitney U: dos muestras independientes
  6. Kruskal-Wallis: la alternativa al ANOVA
  7. Spearman, revisitado
  8. Tabla-guía y flowchart de decisión

Cuándo fallan los supuestos paramétricos

Tres escenarios típicos disparan la alarma:

  • No normalidad con muestra pequeña. Con \(n\) grande, el TCL protege a la media muestral aunque la población sea asimétrica; con \(n = 8\) o \(n = 12\), no hay teorema que valga: si los datos son asimétricos (como los tiempos de entrega, con su cola derecha — mediana 25,5 h y un 13 % fuera de SLA), la prueba t puede dar valores p que no significan lo que dicen.
  • Datos ordinales. Una satisfacción de 8 es más que una de 4, pero ¿es "el doble"? Las escalas de valoración ordenan pero no garantizan distancias iguales entre puntos; calcular medias y desviaciones sobre ellas es, en rigor, abusivo. Los rangos usan exactamente la información que la escala sí ofrece: el orden.
  • Atípicos extremos. Un solo valor salvaje infla \(\bar{x}\) y sobre todo \(s\), y puede tanto fabricar significación falsa como enmascarar un efecto real. Los rangos son inmunes: el valor más grande recibe el último rango, dé igual que sea 48 o 4.800.

La idea común de todas las pruebas de esta lección: sustituir cada dato por su posición en la ordenación conjunta y hacer la inferencia sobre esas posiciones. Como los rangos de \(n\) datos son siempre \(1, 2, \dots, n\), su comportamiento bajo la hipótesis nula se conoce exactamente, sin suponer nada sobre la distribución original. Por eso estas pruebas suelen contrastar hipótesis sobre medianas (o sobre "tendencia a valores mayores") en lugar de sobre medias.

Qué se gana y qué se pierde: el precio en potencia

No hay comida gratis. Al pasar de los valores a los rangos se descarta información (que 48 h está muy lejos de 29 h, no solo "después"), y descartar información cuesta potencia (Módulo 5: la capacidad de detectar un efecto que existe).

Prueba paramétrica Prueba no paramétrica
Supuestos Distribución (normalidad) o \(n\) grande Mínimos (muestras aleatorias, escala al menos ordinal)
Qué contrasta Medias Medianas / desplazamiento de la distribución
Con datos realmente normales Máxima potencia Algo menos potente (Wilcoxon y Mann-Whitney rinden ≈ 95 % de la potencia de la t)
Con asimetría o atípicos Puede fallar gravemente Robusta, a menudo más potente
Resultado que comunica "La media sube X €" "El nivel típico sube" (sin cifra de efecto en € directa)

Dos consecuencias prácticas: primero, si los supuestos paramétricos se sostienen, usa la prueba paramétrica — la pérdida de potencia del método no paramétrico es pequeña pero es una pérdida; segundo, el resultado no paramétrico es menos rico (dice "hay diferencia", pero no da un intervalo en euros sobre la media), así que acompáñalo siempre de descriptivos robustos: medianas y rangos intercuartílicos, que ya dominas del Módulo 2.

La prueba de los signos: la idea más simple

Empecemos por la prueba no paramétrica más elemental, útil para datos pareados (antes/después en las mismas unidades). Su lógica cabe en una frase: si el tratamiento no hiciera nada, cada unidad tendría un 50 % de probabilidad de mejorar y un 50 % de empeorar — así que el número de mejoras sería una binomial con \(p = 0{,}5\), la vieja conocida del Módulo 4.

Ejemplo relámpago: NovaMarket prueba una promoción de fruta de temporada en 10 tiendas, comparando la venta de fresca de la semana de promoción con la de la semana anterior. Suben 9 tiendas y baja 1 (los empates exactos se descartan). Bajo la hipótesis nula, el número de subidas es \(Bin(10;, 0{,}5)\):

\[ P(X \geq 9) = P(X=9) + P(X=10) = \frac{10 + 1}{2^{10}} = \frac{11}{1024} \approx 0{,}0107 \]

A dos colas, valor p ≈ 0,021 < 0,05: la promoción movió las ventas. La prueba de los signos solo usa la dirección de cada cambio, ignorando su tamaño; es la menos potente de la familia, pero también la de supuestos más débiles y la más fácil de explicar en un comité. El siguiente paso natural es aprovechar también el tamaño de los cambios — sin volver a las medias — usando sus rangos: eso es Wilcoxon.

Wilcoxon de rangos con signo: datos pareados

La prueba de Wilcoxon de rangos con signo es la alternativa no paramétrica a la t pareada. Caso: Valencia-Ruzafa ha estrenado reforma, y 8 clientes del panel de mystery shoppers puntuaron la tienda antes y después:

Cliente Antes Después Diferencia \(d\) \(\lvert d \rvert\) Rango de \(\lvert d \rvert\) Rango con signo
1 6,8 7,6 +0,8 0,8 5 +5
2 7,2 7,5 +0,3 0,3 3 +3
3 6,5 7,4 +0,9 0,9 7 +7
4 7,0 6,8 −0,2 0,2 2 −2
5 7,4 8,1 +0,7 0,7 4 +4
6 6,9 7,8 +0,9 0,9 7 +7
7 7,1 7,0 −0,1 0,1 1 −1
8 6,6 7,5 +0,9 0,9 7 +7

Paso a paso:

  1. Calcular las diferencias después − antes (los ceros se descartan; aquí no hay).
  2. Ordenar por valor absoluto y asignar rangos: el menor \(\lvert d \rvert\) (0,1) recibe rango 1, y así sucesivamente. Los tres 0,9 empatan en las posiciones 6, 7 y 8, así que cada uno recibe el rango promedio \((6+7+8)/3 = 7\).
  3. Sumar por separado los rangos de las diferencias positivas y negativas:
    • \(W^+ = 5 + 3 + 7 + 4 + 7 + 7 = 33\)
    • \(W^- = 2 + 1 = 3\)
    • Comprobación: \(33 + 3 = 36 = \frac{8 \times 9}{2}\) ✓ (la suma de rangos de \(n\) datos siempre es \(n(n+1)/2\)).
  4. Estadístico: \(W = \min(W^+, W^-) = 3\). La lógica: si la reforma no cambiara nada, positivos y negativos se repartirían los rangos a partes iguales (cada suma rondaría 18); un \(W\) muy pequeño delata el desequilibrio.
  5. Decisión: para \(n = 8\) y \(\alpha = 0{,}05\) bilateral, el valor crítico tabulado es 3 — se rechaza \(H_0\) si \(W \leq 3\). Como \(W = 3\), se rechaza: la mejora de valoraciones tras la reforma es estadísticamente significativa.

Fíjate en el contraste con la prueba de los signos: con 6 mejoras y 2 empeoramientos, la de los signos no habría alcanzado la significación (\(P(X \geq 6) \approx 0{,}145\) para una cola); Wilcoxon sí, porque además de contar direcciones observa que los empeoramientos son minúsculos (rangos 1 y 2) y las mejoras, grandes. Ese uso extra de información es potencia recuperada.

Para \(n > 20\)–25, \(W\) se aproxima bien por una normal y el software da un valor p directamente; el mecanismo de rangos es el mismo.

Mann-Whitney U: dos muestras independientes

La prueba U de Mann-Whitney (equivalente a la de Wilcoxon de suma de rangos) es la alternativa a la t de dos muestras independientes. Caso: logística compara los tiempos de entrega (horas) de los dos transportistas que reparten la zona centro. Muestras pequeñas y una distribución que sabemos asimétrica: terreno no paramétrico.

  • Transportista A (\(n_1 = 5\)): 21, 23, 26, 29, 34
  • Transportista B (\(n_2 = 6\)): 28, 31, 35, 38, 41, 44

Paso a paso:

  1. Ordenar las 11 observaciones juntas y asignar rangos globales:
Valor 21 23 26 28 29 31 34 35 38 41 44
Rango 1 2 3 4 5 6 7 8 9 10 11
Grupo A A A B A B A B B B B
  1. Sumar los rangos de un grupo: \(R_A = 1 + 2 + 3 + 5 + 7 = 18\).
  2. Calcular U:

\[ U_A = n_1 n_2 + \frac{n_1(n_1+1)}{2} - R_A = 30 + 15 - 18 = 27 \qquad U_B = n_1 n_2 - U_A = 30 - 27 = 3 \]

\(U_B = 3\) tiene una lectura muy concreta: de los \(5 \times 6 = 30\) cruces posibles entre un dato de A y uno de B, solo en 3 el de B llega antes. El estadístico es \(U = \min(U_A, U_B) = 3\).

  1. Decisión: el valor crítico tabulado para \(n_1 = 5\), \(n_2 = 6\), \(\alpha = 0{,}05\) bilateral es 3 — se rechaza si \(U \leq 3\). Como \(U = 3\), se rechaza: el transportista A entrega sistemáticamente antes (mediana 26 h frente a 36,5 h). Con el SLA en juego, hay argumento estadístico para renegociar el reparto de rutas.

Ventaja añadida en este contexto: si mañana un pedido de B tarda 90 horas por una incidencia, su rango seguiría siendo 11 y la conclusión no se movería — la misma prueba t habría visto su \(s\) inflarse y quizá perder la significación por culpa del atípico.

Kruskal-Wallis: la alternativa al ANOVA

¿Y con más de dos grupos? La prueba de Kruskal-Wallis extiende Mann-Whitney a \(k\) grupos igual que el ANOVA de 06-03 extendía la t. La hipótesis nula: las \(k\) poblaciones tienen la misma distribución (mismas medianas); la mecánica: rangos globales y comparar las sumas de rangos por grupo con lo esperable bajo \(H_0\):

\[ H = \frac{12}{N(N+1)} \sum_{i=1}^{k} \frac{R_i^2}{n_i} - 3(N+1) \]

donde \(N\) es el total de observaciones y \(R_i\) la suma de rangos del grupo \(i\). Bajo \(H_0\), \(H\) sigue aproximadamente una chi-cuadrado con \(k-1\) grados de libertad — la misma distribución de 06-04 en un papel nuevo.

Caso operativo: en lugar de las medias de satisfacción por formato del ANOVA, auditoría interna puntúa el cumplimiento de estándares de tienda (escala ordinal 0–10) en 4 tiendas de cada formato:

Formato Puntuaciones Rangos globales \(R_i\)
Express 6,6 · 7,1 · 6,9 · 7,4 1 · 3 · 2 · 4 10
Estándar 7,8 · 8,2 · 7,9 · 8,4 5 · 7 · 6 · 8 26
Gran Superficie 8,8 · 9,1 · 8,7 · 9,3 10 · 11 · 9 · 12 42

Con \(N = 12\):

\[ H = \frac{12}{12 \times 13}\left(\frac{10^2}{4} + \frac{26^2}{4} + \frac{42^2}{4}\right) - 3 \times 13 = \frac{12}{156}(25 + 169 + 441) - 39 = 0{,}0769 \times 635 - 39 = 9{,}85 \]

Comparando con \(\chi^2_{0{,}05;,2} = 5{,}99\): como \(9{,}85 > 5{,}99\), se rechaza \(H_0\) (valor p ≈ 0,007): el cumplimiento de estándares difiere entre formatos, con los rangos escalando limpiamente de Express a Gran Superficie — el eco no paramétrico del gradiente 7,0/8,0/9,0 que el ANOVA encontró en satisfacción. Igual que el ANOVA, Kruskal-Wallis es una prueba ómnibus: dice que algún grupo difiere, no cuál; para localizarlo se hacen comparaciones dos a dos con Mann-Whitney corrigiendo por comparaciones múltiples (Bonferroni, como en 06-03).

Spearman, revisitado

La correlación de Spearman ya la conoces de 06-01: es exactamente el coeficiente de Pearson calculado sobre rangos, y por eso pertenece de pleno derecho a esta familia. Aquí solo hay que situarla: es la alternativa no paramétrica a Pearson cuando la relación es monótona pero no lineal, cuando hay atípicos o cuando alguna variable es ordinal. El \(r_s = -0{,}95\) entre tiempo de entrega y satisfacción que calculamos entonces es un análisis no paramétrico hecho y derecho — ya estabas usando rangos antes de saber que eso tenía nombre.

Tabla-guía y flowchart de decisión

La tabla que resume el módulo 5, el 6 y esta lección — la chuleta definitiva para elegir prueba:

Pregunta de negocio Prueba paramétrica Alternativa no paramétrica Cuándo usar la no paramétrica
¿Una mediana/media difiere de un valor de referencia? t de una muestra (05-03) Wilcoxon de rangos con signo (contra el valor de referencia); signos \(n\) pequeño y asimetría, ordinales, atípicos
¿Cambió tras una intervención (mismas unidades)? t pareada (05-03) Signos; Wilcoxon de rangos con signo Ídem; signos si solo es fiable la dirección del cambio
¿Difieren dos grupos independientes? t de dos muestras (05-03) Mann-Whitney U Ídem
¿Difieren \(k\) grupos independientes? ANOVA de un factor (06-03) Kruskal-Wallis No normalidad, ordinales, varianzas muy dispares con grupos pequeños
¿Se asocian dos variables numéricas? Correlación de Pearson (06-01) Correlación de Spearman Relación monótona no lineal, atípicos, ordinales
¿Se asocian dos variables categóricas? — Chi-cuadrado de independencia (06-04) Es ya una prueba sin supuestos distribucionales sobre los datos: no necesita "alternativa"

Y el flowchart de decisión:

flowchart TD
    A[¿Qué tipo de datos comparas?] --> B{¿Variables categóricas?}
    B -- Sí --> C[Chi-cuadrado 06-04]
    B -- No --> D{¿Datos numéricos con normalidad razonable o n grande, sin atípicos graves?}
    D -- Sí --> E{¿Cuántos grupos?}
    E -- "1 o pareado" --> F[t de una muestra / t pareada]
    E -- "2 independientes" --> G[t de dos muestras]
    E -- "3 o más" --> H[ANOVA]
    E -- "relación entre 2 variables" --> I[Pearson / regresión]
    D -- "No: n pequeño, ordinales o atípicos" --> J{¿Cuántos grupos?}
    J -- "pareado" --> K[Signos / Wilcoxon]
    J -- "2 independientes" --> L[Mann-Whitney U]
    J -- "3 o más" --> M[Kruskal-Wallis]
    J -- "relación entre 2 variables" --> N[Spearman]

Existe además una tercera vía moderna que solo dejamos mencionada: el bootstrap, que sustituye los supuestos por remuestreo intensivo con ordenador.

Errores Comunes y Consejos

  • Usar métodos no paramétricos "por si acaso" con datos normales y n grande. Regalas potencia sin necesidad; lo no paramétrico es un plan B fundado, no el plan por defecto.
  • Interpretar Mann-Whitney o Kruskal-Wallis como comparaciones de medias. Contrastan medianas/desplazamiento; reporta medianas y RIC junto al valor p, no medias.
  • Olvidar el tratamiento de empates. Los valores repetidos reciben el rango promedio de sus posiciones (los tres 0,9 del ejemplo → rango 7 cada uno); repartir rangos arbitrariamente entre empatados cambia el resultado.
  • Descartar mal los ceros y empates en signos/Wilcoxon. Las diferencias exactamente cero se eliminan antes de contar \(n\); olvidarlo desplaza los valores críticos.
  • Confundir el sentido de la regla de decisión. En Wilcoxon y Mann-Whitney se rechaza cuando el estadístico es menor o igual que el crítico tabulado (al revés que en t, F o chi-cuadrado, donde se rechaza por arriba). Es el despiste clásico con estas tablas.
  • Saltarse la corrección por comparaciones múltiples tras Kruskal-Wallis. Hacer tres Mann-Whitney a \(\alpha = 0{,}05\) sin corregir infla el error tipo I global, exactamente igual que en el post-hoc del ANOVA.
  • Renunciar a los descriptivos. "p < 0,05 con Mann-Whitney" no le dice a Marta cuánto mejor es el transportista A; la mediana de cada grupo (26 h vs 36,5 h) sí.

Ejercicios

Ejercicio 1

Se prueba una nueva disposición de la sección de droguería en 9 tiendas, comparando ventas de la categoría antes y después. Suben 8 tiendas y baja 1. Aplica la prueba de los signos con \(\alpha = 0{,}05\) bilateral. (Ayuda: \(P(X \geq 8)\) con \(Bin(9;,0{,}5)\) = \( (9 + 1 + \binom{9}{7} \cdot 0)/2^9 \)... calcula \(P(X=8) + P(X=9)\).)

Ejercicio 2

Seis empleados de Bilbao-Casco valoraron el clima laboral (0–10) antes y después de un cambio de turnos: diferencias después − antes: +1,5; +0,5; −0,3; +1,1; +0,8; −0,6. Realiza la prueba de Wilcoxon de rangos con signo (valor crítico bilateral para \(n = 6\), \(\alpha = 0{,}05\): se rechaza si \(W \leq 0\)).

Ejercicio 3

Tiempo (minutos) en resolver una incidencia de caja en dos tiendas: Madrid-Chamberí (\(n_1 = 4\)): 5, 7, 8, 12; Zaragoza-Centro (\(n_2 = 5\)): 9, 13, 15, 18, 40. Calcula U de Mann-Whitney (valor crítico bilateral para \(n_1 = 4, n_2 = 5\), \(\alpha = 0{,}05\): se rechaza si \(U \leq 1\)) y comenta el papel del valor 40.

Soluciones

Ejercicio 1.

\(P(X = 8) = \binom{9}{8}/2^9 = 9/512\); \(P(X = 9) = 1/512\). Una cola: \(10/512 \approx 0{,}0195\); bilateral: \(\approx 0{,}039 < 0{,}05\). Se rechaza \(H_0\): la nueva disposición mueve las ventas de droguería. Error frecuente: olvidar duplicar para el contraste bilateral y reportar 0,0195 — si la pregunta era "¿cambia?" (no "¿sube?"), el valor p es el doble.

Ejercicio 2.

Valores absolutos ordenados: 0,3 (rango 1); 0,5 (2); 0,6 (3); 0,8 (4); 1,1 (5); 1,5 (6). Sumas: \(W^- = 1 + 3 = 4\) (las diferencias −0,3 y −0,6); \(W^+ = 2 + 4 + 5 + 6 = 17\); comprobación \(4 + 17 = 21 = 6 \times 7/2\) ✓. \(W = \min = 4 > 0\): no se rechaza \(H_0\). Con \(n = 6\), solo un resultado perfecto (todas las diferencias del mismo signo) alcanzaría la significación: la muestra es demasiado pequeña para concluir — lo que conecta con la lección de potencia: ausencia de evidencia no es evidencia de ausencia. Error frecuente: asignar los rangos sobre las diferencias con signo en lugar de sobre sus valores absolutos.

Ejercicio 3.

Ordenación conjunta: 5(1), 7(2), 8(3), 9(4), 12(5), 13(6), 15(7), 18(8), 40(9). Rangos de Chamberí: 1, 2, 3, 5 → \(R_1 = 11\). \(U_1 = 4 \times 5 + \frac{4 \times 5}{2} - 11 = 20 + 10 - 11 = 19\); \(U_2 = 20 - 19 = 1\). \(U = 1 \leq 1\): se rechaza \(H_0\): Chamberí resuelve las incidencias más rápido (medianas 7,5 vs 15 min). El valor 40 (¿una incidencia que hubo que escalar?) recibe simplemente el rango 9: la conclusión sería idéntica si fuera 20 o 400 — con una prueba t, ese único dato habría disparado la desviación típica de Zaragoza y probablemente arruinado la significación. Error frecuente: calcular U con la suma de rangos del grupo equivocado sin ajustar la fórmula; comprueba siempre que \(U_1 + U_2 = n_1 n_2\).

Conclusión

Con esta lección se cierra el arsenal técnico del curso: sabes cuándo los supuestos paramétricos fallan (n pequeño sin normalidad, ordinales, atípicos), qué cuesta renunciar a ellos (algo de potencia y la riqueza del efecto en unidades), y manejas la escalera completa — signos para la dirección, Wilcoxon para pares, Mann-Whitney para dos grupos, Kruskal-Wallis para varios, Spearman para asociación — junto con la tabla-guía y el flowchart que emparejan cada prueba paramétrica con su doble robusto. La reforma de Valencia-Ruzafa, el transportista lento y el gradiente de estándares por formato han caído ante pruebas que no piden permiso a la campana de Gauss.

Y con el Módulo 7 termina también la construcción de herramientas: descriptiva, probabilidad, distribuciones, inferencia, regresión, ANOVA, chi-cuadrado, series temporales, multivariante y no paramétricos. Lo que queda es lo más parecido al trabajo real de un analista: enfrentarse a un caso completo y decidir, sin que nadie sople el método, qué herramienta responde a qué pregunta. Eso es el Módulo 8: aplicar todo el arsenal, sector a sector, empezando por el terreno natural de NovaMarket — la Estadística en Negocios.

© Copyright 2026. Todos los derechos reservados