Los intervalos de confianza de la lección anterior nos dejaron afirmaciones del tipo «la brecha tienda vs online está entre 0,4 y 1 punto». En esta lección aprenderemos la otra gran maquinaria de la inferencia: las pruebas de hipótesis (o contrastes), el procedimiento formal para decidir entre dos afirmaciones enfrentadas — «el cambio no ha tenido efecto» frente a «sí lo ha tenido» — con un riesgo de error conocido y controlado. Veremos la lógica del contraste (sorprendentemente parecida a un juicio), el papel del valor p (la cifra más citada y peor entendida de toda la estadística) y lo aplicaremos a tres decisiones reales de NovaMarket: si el nuevo diseño de la app sube el ticket medio, si logística está incumpliendo su SLA de entregas, y si la satisfacción online es de verdad peor que la de tienda.

Contenido

  1. La lógica del contraste: presunción de inocencia
  2. Hipótesis nula y alternativa; contrastes unilaterales y bilaterales
  3. El procedimiento en cinco pasos: estadístico, α y regla de decisión
  4. Caso 1 — ¿El nuevo diseño de la app sube el ticket medio? (contraste z para una media)
  5. El valor p: interpretación correcta y malinterpretaciones célebres
  6. Caso 2 — ¿Se está incumpliendo el SLA de entregas? (contraste para una proporción)
  7. Contraste t para una media y la conexión IC ↔ contraste
  8. Caso 3 — Tienda vs online (contraste para dos medias)
  9. Significación estadística vs relevancia práctica

La lógica del contraste: presunción de inocencia

Un contraste de hipótesis funciona exactamente como un juicio penal:

En el juicio En el contraste
Presunción de inocencia Hipótesis nula \( H_0 \): «no hay efecto, no hay cambio»
Acusación Hipótesis alternativa \( H_1 \): «sí hay efecto»
Pruebas presentadas Datos de la muestra
«Culpable más allá de toda duda razonable» Los datos son muy improbables si \( H_0 \) fuera cierta
Veredicto: culpable Rechazamos \( H_0 \)
Veredicto: no culpable No rechazamos \( H_0 \) — que no es lo mismo que «probada la inocencia»

Tres ideas clave de la analogía:

  • La carga de la prueba recae sobre la alternativa. Partimos de que el cambio no funciona, y solo lo daremos por bueno si los datos lo respaldan con fuerza. Es un diseño deliberadamente conservador: protege a la empresa de perseguir espejismos.
  • Nunca «aceptamos» \( H_0 \). Un veredicto de «no culpable» no certifica inocencia; solo dice que las pruebas no bastaron. Igualmente, «no rechazar \( H_0 \)» significa «los datos no bastan para afirmar el efecto», no «hemos demostrado que no hay efecto».
  • «Más allá de toda duda razonable» necesita un umbral numérico. Ese umbral será \( \alpha \), el nivel de significación.

Hipótesis nula y alternativa; contrastes unilaterales y bilaterales

  • \( H_0 \) (nula): la afirmación de statu quo, siempre con el signo igual: \( \mu = \mu_0 \), \( p = p_0 \). Es la que se somete a juicio.
  • \( H_1 \) (alternativa): lo que queremos detectar. Su forma define el tipo de contraste:
Tipo \( H_1 \) Cuándo usarlo Ejemplo NovaMarket
Unilateral derecho \( \mu > \mu_0 \) Solo interesa detectar subidas ¿El rediseño de la app sube el ticket?
Unilateral izquierdo \( \mu < \mu_0 \) Solo interesa detectar bajadas ¿Ha caído la satisfacción tras el cambio de proveedor?
Bilateral \( \mu \neq \mu_0 \) Cualquier desviación importa ¿El peso real de las bandejas de 500 g difiere de lo etiquetado?

Regla de oro: la dirección del contraste se decide antes de mirar los datos, según la pregunta de negocio — nunca después, mirando hacia dónde salió la muestra (eso infla artificialmente los resultados, como veremos al hablar de p-hacking en la próxima lección).

El procedimiento en cinco pasos: estadístico, α y regla de decisión

Todo contraste sigue la misma liturgia:

  1. Plantear \( H_0 \) y \( H_1 \) (y decidir si es uni o bilateral).
  2. Fijar el nivel de significación \( \alpha \): la probabilidad máxima que aceptamos de rechazar \( H_0 \) siendo cierta (condenar a un inocente). Convenciones habituales: 0,05 (estándar), 0,01 (exigente), 0,10 (exploratorio). Se fija antes de ver los datos.
  3. Calcular el estadístico de contraste: una medida de discrepancia entre lo observado y lo que \( H_0 \) predice, en unidades de error típico. Para una media es la puntuación z del Módulo 2 aplicada a \( \bar{x} \): \[ z = \frac{\bar{x} - \mu_0}{\sigma/\sqrt{n}} \qquad \text{o} \qquad t = \frac{\bar{x} - \mu_0}{s/\sqrt{n}} \] Se lee: «¿a cuántos errores típicos está mi muestra de lo que dice la nula?».
  4. Decidir, por cualquiera de estas dos vías equivalentes:
    • Región crítica: rechazar si el estadístico supera el valor crítico de la tabla (1,645 para unilateral al 5 %; 1,96 para bilateral al 5 %…).
    • Valor p: calcular la probabilidad de un resultado tan extremo como el observado, suponiendo cierta \( H_0 \), y rechazar si \( p < \alpha \).
  5. Concluir en lenguaje de negocio, no en jerga: qué se decidió, con qué riesgo, y qué implica.

Caso 1 — ¿El nuevo diseño de la app sube el ticket medio? (contraste z para una media)

El equipo de producto rediseñó la pantalla de pago de la app con recomendaciones personalizadas. El ticket medio histórico de NovaMarket es \( \mu_0 = 32{,}40 \) € con \( \sigma = 21{,}50 \) € (Módulo 2), y se asume que el rediseño no cambia la dispersión. Tras el lanzamiento se toma una muestra aleatoria de \( n = 225 \) tickets de la app: \( \bar{x} = 34{,}60 \) €.

Paso 1. \( H_0: \mu = 32{,}40 \) (el rediseño no cambia nada) frente a \( H_1: \mu > 32{,}40 \) (unilateral: solo nos interesa la subida).

Paso 2. \( \alpha = 0{,}05 \).

Paso 3. Error típico: \( 21{,}50/\sqrt{225} = 21{,}50/15 = 1{,}433 \) €. Estadístico:

\[ z = \frac{34{,}60 - 32{,}40}{1{,}433} = \frac{2{,}20}{1{,}433} \approx 1{,}53 \]

La media muestral está 1,53 errores típicos por encima de lo que predice la nula.

Paso 4. Valor crítico unilateral al 5 %: 1,645. Como \( 1{,}53 < 1{,}645 \), no rechazamos \( H_0 \). Por la vía del valor p: \( p = P(Z \ge 1{,}53) = 1 - 0{,}9370 = 0{,}063 \) (tabla Z del Módulo 4). Como \( 0{,}063 > 0{,}05 \), misma decisión.

Paso 5. Conclusión de negocio: «Los tickets de la muestra suben 2,20 € de media, pero con 225 tickets esa subida es compatible con el azar del muestreo (p = 0,063): no podemos afirmar al 5 % que el rediseño aumente el ticket. Resultado prometedor pero no concluyente; recomendamos ampliar la muestra antes de extender el diseño». Ojo: no hemos demostrado que el rediseño no funcione — solo que las pruebas aún no bastan. La diferencia entre «no detectado» y «no existe» es el corazón de la próxima lección.

El valor p: interpretación correcta y malinterpretaciones célebres

Definición correcta: el valor p es la probabilidad de obtener un resultado tan extremo o más que el observado, suponiendo que \( H_0 \) es cierta. Es una medida de sorpresa: p pequeño = «si la nula fuera verdad, ver esto sería muy raro» → desconfiamos de la nula.

En el caso 1: si el rediseño no hiciera nada, una muestra con media ≥ 34,60 € aparecería el 6,3 % de las veces por puro azar. Raro, pero no rarísimo.

Las malinterpretaciones del valor p son tan frecuentes que la Asociación Americana de Estadística publicó en 2016 un comunicado oficial para combatirlas. Las cuatro más célebres:

Malinterpretación Por qué es falsa
«p = 0,063 es la probabilidad de que \( H_0 \) sea cierta» El p se calcula suponiendo \( H_0 \) cierta; no puede medir su probabilidad. Mide P(datos | H₀), no P(H₀ | datos) — la confusión de condicionadas que ya desmontamos con Bayes en el Módulo 3
«p = 0,04 significa que hay un 96 % de probabilidad de que el efecto sea real» Mismo error, con lazo
«p > 0,05 demuestra que no hay efecto» Solo indica ausencia de pruebas suficientes; quizá la muestra era pequeña
«p = 0,049 es un hallazgo y p = 0,051 no es nada» El 0,05 es una convención, no una ley física; dos resultados casi idénticos no deberían recibir veredictos opuestos. Reporta siempre el p exacto

Consejo profesional: en los informes, acompaña siempre el valor p del tamaño del efecto (los 2,20 € de subida) y, si puedes, de su intervalo de confianza. El p dice «cuán seguro»; el efecto dice «cuánto importa».

Caso 2 — ¿Se está incumpliendo el SLA de entregas? (contraste para una proporción)

El SLA de NovaMarket Online promete que como máximo el 10 % de las entregas supera las 48 horas (recordemos: F(48) = 0,899 en el modelo del Módulo 4, un ~10 % fuera de plazo). Operaciones sospecha que el nuevo operador logístico lo está incumpliendo. Se auditan \( n = 300 \) entregas: 39 fuera de plazo, es decir, \( \hat{p} = 0{,}13 \).

Planteamiento. \( H_0: p = 0{,}10 \) (se cumple el SLA) frente a \( H_1: p > 0{,}10 \) (se incumple). \( \alpha = 0{,}05 \).

Estadístico. Con proporciones, el error típico se calcula con el valor de la nula (\( p_0 \)), porque el contraste se hace «como si \( H_0 \) fuera cierta»:

\[ z = \frac{\hat{p} - p_0}{\sqrt{\dfrac{p_0(1-p_0)}{n}}} = \frac{0{,}13 - 0{,}10}{\sqrt{\dfrac{0{,}10 \times 0{,}90}{300}}} = \frac{0{,}03}{0{,}01732} \approx 1{,}73 \]

(Validez: \( np_0 = 30 \) y \( n(1-p_0) = 270 \), ambos ≥ 10, así que la aproximación normal del Módulo 4 es legítima.)

Decisión. \( 1{,}73 > 1{,}645 \): rechazamos \( H_0 \). Valor p: \( P(Z \ge 1{,}73) = 1 - 0{,}9582 = 0{,}042 < 0{,}05 \).

Conclusión de negocio: «Con un 13 % de entregas fuera de plazo en 300 auditadas, hay evidencia significativa al 5 % de que el operador incumple el SLA del 10 % (p = 0,042). Recomendamos activar la cláusula de revisión del contrato y repetir la auditoría el próximo mes». Nota la prudencia: p = 0,042 es significativo pero no aplastante; una segunda auditoría protege la decisión.

Contraste t para una media y la conexión IC ↔ contraste

Cuando \( \sigma \) es desconocida (lo normal), el estadístico usa \( s \) y se compara con la tabla t con \( n-1 \) grados de libertad, exactamente como en los intervalos.

Ejemplo: el gasto del Club Nova contra el objetivo. Finanzas fijó hace años un supuesto de planificación: «el socio medio gasta 120 € al mes». ¿Lo desmienten nuestros datos (\( n = 60 \), \( \bar{x} = 126{,}40 \), \( s = 38{,}50 \), ET = 4,97)?

  • \( H_0: \mu = 120 \) frente a \( H_1: \mu \neq 120 \) (bilateral: nos importaría tanto quedarnos cortos como pasarnos). \( \alpha = 0{,}05 \).
  • \( t = \dfrac{126{,}40 - 120}{4{,}97} = \dfrac{6{,}40}{4{,}97} \approx 1{,}29 \)
  • Crítico bilateral: \( t_{0{,}025,,59} = 2{,}001 \). Como \( |1{,}29| < 2{,}001 \), no rechazamos. (El p bilateral ronda 0,20.)
  • Conclusión: «los datos son compatibles con el supuesto de 120 €; no hay base para revisar el plan financiero».

La conexión con los intervalos. En la lección anterior obtuvimos el IC al 95 % del gasto: [116,46; 136,34]. Fíjate: contiene el 120, y el contraste bilateral al 5 % no rechaza \( \mu = 120 \). No es casualidad, es un teorema en miniatura:

Un contraste bilateral al nivel \( \alpha \) rechaza \( H_0: \mu = \mu_0 \) exactamente cuando \( \mu_0 \) queda fuera del IC al \( (1-\alpha) \) de confianza.

El intervalo es, literalmente, «el conjunto de todas las nulas que sobrevivirían al contraste». Por eso muchos analistas prefieren reportar el IC: contiene la misma decisión y además el tamaño del efecto.

Caso 3 — Tienda vs online (contraste para dos medias)

Cerramos el caso abierto en la lección anterior: satisfacción en tienda \( \bar{x}_1 = 8{,}3 \) (\( n_1 = 450 \), \( s_1 = 1{,}5 \)) frente a online \( \bar{x}_2 = 7{,}6 \) (\( n_2 = 190 \), \( s_2 = 1{,}9 \)). Marta pregunta: «¿la online es realmente peor, o es ruido?».

  • \( H_0: \mu_1 - \mu_2 = 0 \) frente a \( H_1: \mu_1 - \mu_2 \neq 0 \). \( \alpha = 0{,}05 \). (Planteamos bilateral: antes de ver los datos, la diferencia podría haber ido en cualquier sentido.)
  • Estadístico (muestras grandes e independientes; el error típico de la diferencia, 0,155, ya lo calculamos):

\[ z = \frac{(8{,}3 - 7{,}6) - 0}{\sqrt{\dfrac{1{,}5^2}{450} + \dfrac{1{,}9^2}{190}}} = \frac{0{,}70}{0{,}155} \approx 4{,}52 \]

  • Decisión: \( 4{,}52 \gg 1{,}96 \); el valor p bilateral es menor que 0,0001 (fuera del rango de la tabla Z: 4,52 errores típicos es territorio de «prácticamente imposible por azar»).
  • Coherencia con el IC: [0,40; 1,00] no contenía el cero — misma conclusión, como debía ser.

Conclusión de negocio: «La diferencia de 0,7 puntos entre tienda y online es estadísticamente inequívoca (p < 0,0001). El canal online tiene un problema real de satisfacción; proponemos investigar sus causas — los plazos de entrega del caso 2 son el primer sospechoso».

Significación estadística vs relevancia práctica

Última idea de la lección, y quizá la más importante para un profesional: significativo no significa importante. «Significativo» solo quiere decir «difícil de atribuir al azar». Con muestras enormes, efectos minúsculos e irrelevantes salen significativos; con muestras pequeñas, efectos grandes y valiosos pueden no salirlo.

Situación p Efecto Lectura correcta
Encuesta a 500.000 clientes: satisfacción 8,10 vs 8,13 0,001 0,03 puntos Significativo e irrelevante: nadie nota 0,03 puntos; no justifica ninguna acción
Caso 1 (app): +2,20 € de ticket con n = 225 0,063 +6,8 % del ticket No significativo pero potencialmente muy relevante: merece más muestra, no la papelera

El protocolo profesional: mirar siempre las dos cosas — el valor p (¿es real?) y el tamaño del efecto con su IC (¿cuánto es y cuánto importa?) — y traducir ambas al idioma del negocio (euros, puntos, clientes). Decidir cuánta muestra hace falta para que un efecto relevante resulte también detectable es exactamente el problema del que se ocupa la siguiente lección.

Errores Comunes y Consejos

  • «Aceptar \( H_0 \)». No rechazar no es aceptar. Escribe «no hay evidencia suficiente de que…», nunca «queda demostrado que no…». El caso de la app es el ejemplo canónico.
  • Elegir la dirección del contraste después de ver los datos. Convertir un bilateral en unilateral a posteriori divide el p por dos de forma tramposa. La hipótesis se fija antes de mirar.
  • Interpretar p como P(H₀ cierta). Es P(datos tan extremos | H₀), y las condicionadas no se voltean gratis (Bayes, Módulo 3).
  • Usar \( \hat{p} \) en vez de \( p_0 \) en el error típico del contraste de proporción. En el contraste, el error típico se calcula bajo la nula (\( p_0 \)); en el intervalo, con \( \hat{p} \). Es la diferencia operativa entre ambas herramientas.
  • Tratar 0,05 como frontera sagrada. p = 0,049 y p = 0,051 dicen casi lo mismo. Reporta el p exacto y el efecto, y deja que la decisión pondere costes y contexto.
  • Ignorar el tamaño del efecto. Un asterisco de significación sin euros detrás no debería mover ninguna decisión.

Ejercicios

Ejercicio 1. Bandejas de fruta etiquetadas «500 g». Una muestra de \( n = 49 \) bandejas da \( \bar{x} = 493 \) g con \( \sigma = 21 \) g (conocida por el histórico de la envasadora). Contrasta al 5 % si el peso medio difiere de lo etiquetado (piensa primero si es uni o bilateral) y concluye en lenguaje de negocio.

Ejercicio 2. Marketing afirma que «más de la mitad» de los socios del Club Nova está activa. Con la muestra de la lección 05-01 (\( n = 150 \), 96 activos, \( \hat{p} = 0{,}64 \)), contrasta \( H_0: p = 0{,}50 \) frente a \( H_1: p > 0{,}50 \) al 1 %. Calcula el estadístico, decide y da el valor p aproximado.

Ejercicio 3. Un analista escribe: «p = 0,20 en el contraste del gasto vs 120 €, luego hay un 80 % de probabilidad de que el gasto medio sea distinto de 120 €… no, espera, de que sea igual a 120 €». Explica por qué ambas lecturas son erróneas y da la correcta. Después, sin calcular nada nuevo, di qué habría pasado con el contraste si el IC del 95 % hubiera sido [121,3; 141,2].

Soluciones

Solución 1. Bilateral (\( H_1: \mu \neq 500 \)): un peso de más cuesta margen y un peso de menos es un problema legal — ambas desviaciones importan. ET \( = 21/\sqrt{49} = 3 \) g. \( z = (493-500)/3 = -2{,}33 \). Como \( |-2{,}33| > 1{,}96 \), se rechaza (p bilateral \( = 2 \times P(Z \le -2{,}33) = 2 \times 0{,}0099 \approx 0{,}02 \)). Conclusión: «las bandejas pesan de media significativamente menos de lo etiquetado (unos 7 g, p ≈ 0,02); hay que recalibrar la envasadora y revisar el riesgo de reclamaciones». Error frecuente: plantearlo unilateral izquierdo porque la muestra salió baja — la dirección se decide por la pregunta, no por los datos.

Solución 2. ET bajo la nula: \( \sqrt{0{,}50 \times 0{,}50/150} = \sqrt{0{,}001667} = 0{,}0408 \). \( z = (0{,}64 - 0{,}50)/0{,}0408 \approx 3{,}43 \). Crítico unilateral al 1 %: 2,326. Como \( 3{,}43 > 2{,}326 \), se rechaza; \( p = P(Z \ge 3{,}43) \approx 0{,}0003 \). Conclusión: evidencia muy fuerte de que más de la mitad de los socios está activa, incluso con un α exigente. Error frecuente: usar \( \hat{p} = 0{,}64 \) en el error típico (daría 0,0392); en el contraste se usa \( p_0 = 0{,}50 \).

Solución 3. El valor p no es la probabilidad de ninguna hipótesis: p = 0,20 significa que, si el gasto medio fuera exactamente 120 €, una desviación como la observada (o mayor) aparecería el 20 % de las veces por azar — demasiado frecuente para descartar la nula. Ni «80 % de que sea distinto» ni «20 % de que sea igual». Con un IC del 95 % de [121,3; 141,2], el 120 quedaría fuera del intervalo, y por la equivalencia IC ↔ contraste bilateral, el contraste al 5 % habría rechazado \( H_0: \mu = 120 \). Error frecuente: olvidar que esta equivalencia exige que coincidan el nivel (95 % ↔ 5 %) y el carácter bilateral.

Conclusión

Ya dominas la maquinaria de decisión de la estadística: plantear \( H_0 \) y \( H_1 \) (con la carga de la prueba sobre la alternativa), fijar \( \alpha \) antes de mirar, medir la discrepancia en errores típicos (z o t, para medias y proporciones), traducirla a un valor p bien interpretado y concluir en lenguaje de negocio — sabiendo que el IC y el contraste bilateral son dos caras de la misma moneda, y que la significación estadística nunca sustituye a la relevancia práctica.

Pero en esta lección hemos convivido con dos incomodidades: al rechazar \( H_0 \) podemos estar condenando a un inocente, y al no rechazarla (como con la app) podemos estar dejando escapar un culpable. ¿Cómo se llaman esos dos errores, cuánto cuestan, cómo se equilibran y — la pregunta del millón — cuánta muestra necesito para que mi contraste tenga potencia de verdad? Todo eso, incluida la promesa pendiente del Módulo 1 sobre el famoso «unos 400 encuestados para un ±5 %», se resuelve en Errores, Potencia y Tamaño Muestral.

© Copyright 2026. Todos los derechos reservados