La lección anterior nos dejó dos incomodidades pendientes: al rechazar \( H_0 \) podemos «condenar a un inocente», y al no rechazarla — como nos pasó con el rediseño de la app — podemos «dejar escapar a un culpable». Esta lección pone nombre, número y precio a esos dos errores (tipo I y tipo II), presenta la potencia de un contraste y responde a la pregunta más práctica de toda la inferencia: ¿cuánta muestra necesito? Con ello saldaremos la promesa que dejamos en el Módulo 1 (aquel «unos 400 encuestados dan un ±5 %») y dimensionaremos un proyecto real: el piloto de la campaña de cupones que Marta quiere probar antes de lanzarla a los 380.000 socios del Club Nova. Cerramos con dos avisos de madurez profesional: el peligro de las comparaciones múltiples (p-hacking) y la ética de la honestidad estadística.

Contenido

  1. Los dos errores posibles: tipo I (α) y tipo II (β)
  2. La potencia (1 − β) y qué la aumenta
  3. La compensación entre α y β
  4. Tamaño muestral para estimar una media con un margen de error dado
  5. Tamaño muestral para estimar una proporción: cerrando la promesa del ~400
  6. Dimensionar el piloto de cupones: el efecto mínimo relevante
  7. Comparaciones múltiples y p-hacking
  8. La ética de la honestidad estadística

Los dos errores posibles: tipo I (α) y tipo II (β)

Todo contraste termina en una decisión (rechazar o no rechazar \( H_0 \)) tomada sin conocer la verdad. Cruzando decisión y realidad salen cuatro casillas:

\( H_0 \) es cierta (no hay efecto) \( H_0 \) es falsa (sí hay efecto)
No rechazamos \( H_0 \) Decisión correcta \( (1-\alpha) \) Error tipo II — probabilidad \( \beta \)
Rechazamos \( H_0 \) Error tipo I — probabilidad \( \alpha \) Decisión correcta: potencia \( (1-\beta) \)

La analogía clásica es un detector de incendios:

  • Error tipo I (falsa alarma): el detector suena sin fuego. En NovaMarket: concluir que el rediseño de la app sube el ticket cuando en realidad no hace nada → se despliega a toda la cadena un cambio inútil, con su coste de desarrollo y formación.
  • Error tipo II (incendio no detectado): hay fuego y el detector calla. En NovaMarket: el rediseño sí funcionaba, pero nuestra muestra de 225 tickets no lo detectó (¿te suena? p = 0,063) → se archiva una mejora que valía dinero.

Dos matices importantes:

  • \( \alpha \) lo eliges tú al fijar el nivel de significación: es la tasa de falsas alarmas que tu regla de decisión tolera. Por eso se fija antes de mirar los datos.
  • \( \beta \) no es un número único: depende de cuál sea el efecto real. Si el rediseño sube el ticket 5 €, detectarlo es fácil y \( \beta \) es pequeña; si lo sube 0,50 €, es dificilísimo y \( \beta \) es enorme. Por eso β siempre se calcula «para un efecto supuesto».

La potencia (1 − β) y qué la aumenta

La potencia es la probabilidad de detectar un efecto cuando realmente existe: la sensibilidad del detector de incendios. Un contraste con potencia 0,80 (el estándar habitual en la práctica) encuentra el efecto 4 de cada 5 veces que está ahí; con potencia 0,30, la mayoría de los efectos reales se le escapan — y el estudio es, casi literalmente, tirar el dinero.

Cuatro palancas aumentan la potencia:

Palanca Por qué funciona ¿Controlable?
Más muestra (\( n \uparrow \)) Encoge el error típico: el mismo efecto sobresale más del ruido Sí — la palanca principal
Efecto real más grande Un incendio grande se detecta antes que una brasa No (es la realidad), pero sí decidimos qué efecto mínimo queremos poder detectar
Menos dispersión (\( \sigma \downarrow \)) Menos ruido de fondo A veces: medir mejor, segmentar poblaciones homogéneas
\( \alpha \) más laxo (0,05 → 0,10) Un detector más sensible salta con menos humo Sí, pero a costa de más falsas alarmas

Releamos el caso de la app con estos ojos: con \( n = 225 \), una subida real de 1 € (efecto de 1/1,433 ≈ 0,7 errores típicos) tendría una potencia bajísima — el estudio nació casi incapaz de detectar efectos modestos. El «no significativo» de la lección anterior era, en parte, un problema de diseño, no de realidad. Moraleja: la potencia se decide antes de recoger los datos, no se lamenta después.

La compensación entre α y β

Con la muestra fija, α y β son los dos platillos de una balanza: si haces el criterio más exigente (bajas α de 0,05 a 0,01 para protegerte de falsas alarmas), el listón de rechazo sube y se te escapan más efectos reales (sube β, baja la potencia). Y al revés. Es la sensibilidad del detector de humo: muy sensible = muchas falsas alarmas; muy insensible = incendios sin detectar.

¿Dónde poner el equilibrio? Depende del coste relativo de cada error, que es una decisión de negocio, no de estadística:

Decisión en NovaMarket Error más caro α razonable
Retirar un producto por posible riesgo alimentario Tipo II (no detectar el problema) Laxo (0,10) e incluso actuar con indicios
Rediseñar toda la logística por un piloto Tipo I (falsa alarma carísima) Exigente (0,01)
Test rutinario de una promoción reversible Ninguno domina Estándar (0,05)

La única forma de bajar los dos errores a la vez es más información: aumentar \( n \). Lo que nos lleva a la pregunta estrella.

Tamaño muestral para estimar una media con un margen de error dado

Para estimación, el planteamiento es directo: fijo el margen de error \( E \) que tolero y despejo \( n \) de la fórmula del intervalo. De \( E = z_{\alpha/2} \cdot \sigma/\sqrt{n} \):

\[ n = \left( \frac{z_{\alpha/2} \cdot \sigma}{E} \right)^{2} \]

Ejemplo: el gasto del Club Nova con precisión de ±5 €. El IC de la lección 05-02 salió [116,46; 136,34] — margen de ±9,94 €, que a Finanzas le parece demasiado. Piden ±5 € al 95 %. Usando como \( \sigma \) la mejor información disponible (el \( s = 38{,}50 \) del estudio previo):

\[ n = \left( \frac{1{,}96 \times 38{,}50}{5} \right)^{2} = \left( \frac{75{,}46}{5} \right)^{2} = (15{,}09)^{2} \approx 227{,}8 ;\Rightarrow; n = 228 \]

(Siempre se redondea hacia arriba: 227 socios no garantizan el margen.) Cuadruplicar aproximadamente la muestra (de 60 a 228) para halvar el margen — la ley de la raíz cuadrada una vez más. Y si pidieran ±2,50 €, saldría \( n \approx 912 \): cada duplicación de precisión cuadruplica el coste. Este cálculo convierte una conversación vaga («queremos más precisión») en una decisión presupuestable («¿pagamos 228 o 912 verificaciones?»).

Tamaño muestral para estimar una proporción: cerrando la promesa del ~400

Para una proporción, despejando de su margen de error:

\[ n = \frac{z_{\alpha/2}^{2} \cdot p(1-p)}{E^{2}} \]

Problema: necesitamos \( p \)… que es justo lo que queremos estimar. Dos salidas: usar una estimación previa si existe, o ponerse en el peor caso, \( p = 0{,}5 \), que maximiza \( p(1-p) = 0{,}25 \) y garantiza el margen pase lo que pase.

La promesa del Módulo 1. Cuando diseñamos la encuesta de satisfacción dijimos que «unos 400 encuestados dan un margen de ±5 %». Ahora podemos demostrarlo. Con confianza del 95 %, peor caso y \( E = 0{,}05 \):

\[ n = \frac{1{,}96^{2} \times 0{,}25}{0{,}05^{2}} = \frac{0{,}9604}{0{,}0025} = 384{,}2 ;\Rightarrow; n = 385 \approx 400 \]

Ahí está el famoso ~400 de todas las encuestas electorales y estudios de mercado. La tabla completa del peor caso, útil para presupuestar cualquier encuesta:

Margen deseado (95 %) \( n \) necesario (peor caso)
±10 % 97
±5 % 385
±3 % 1.068
±2 % 2.401
±1 % 9.604

Dos lecturas valiosas: la precisión se encarece cuadráticamente (de ±5 % a ±1 % la muestra se multiplica por 25), y — sorpresa habitual — el tamaño de la población casi no importa: 385 respuestas dan ±5 % igual para los 9.500 socios de Cuenca que para los 380.000 del Club Nova (la corrección por población finita solo ayuda cuando se muestrea una fracción grande de la población, cosa rara en la práctica). La sopa se prueba con una cuchara, sea la olla grande o enorme.

Dimensionar el piloto de cupones: el efecto mínimo relevante

Para contrastes (no solo estimar, sino detectar un efecto), el tamaño muestral depende de cuatro ingredientes que hay que pactar antes del estudio: \( \alpha \), la potencia deseada, la dispersión \( \sigma \) y — la decisión más de negocio de todas — el efecto mínimo relevante (EMR): el efecto más pequeño que merecería la pena detectar.

El caso. Marketing quiere lanzar cupones personalizados a los 380.000 socios del Club Nova, pero antes exige un piloto: grupo con cupón vs grupo de control, comparando el ticket medio (\( \mu_0 = 32{,}40 \) €, \( \sigma = 21{,}50 \) €). Finanzas calcula que la campaña solo es rentable si sube el ticket al menos 1 €: ese es el EMR — subidas menores no pagan el coste de los descuentos.

Para comparar dos grupos con contraste bilateral, la fórmula operativa (que usaremos como receta, sin deducirla) es:

\[ n_{\text{por grupo}} \approx \frac{2,(z_{\alpha/2} + z_{\beta})^{2},\sigma^{2}}{\Delta^{2}} \]

donde \( \Delta \) es el EMR y \( z_{\beta} \) el valor z de la potencia deseada (potencia 0,80 → \( z_{\beta} = 0{,}84 \), el P80 de la normal; potencia 0,90 → 1,282, nuestro viejo conocido P90).

Con \( \alpha = 0{,}05 \) (bilateral, 1,96), potencia 0,80 y \( \Delta = 1 \) €:

\[ n_{\text{por grupo}} \approx \frac{2 \times (1{,}96 + 0{,}84)^{2} \times 21{,}50^{2}}{1^{2}} = \frac{2 \times 7{,}84 \times 462{,}25}{1} \approx 7.248 ;\Rightarrow; \text{unos } 7.250 \text{ socios por grupo} \]

Lectura de negocio: el piloto necesita unos 14.500 socios (7.250 con cupón, 7.250 de control) — perfectamente viable sobre 380.000, pero lejísimos de los «500 y vemos» que proponía Marketing. Con 500 por grupo, la potencia para detectar +1 € rondaría el 10 %: nueve de cada diez veces el piloto diría «no significativo» aunque la campaña funcionara, condenando una buena idea (el error de diseño exacto que cometimos con la app en la lección anterior). Y si el EMR fuera de 2 €, la muestra caería a \( 7.248/4 \approx 1.812 \) por grupo: detectar efectos finos es carísimo; detectar efectos gruesos, barato. El EMR — cuánto tiene que subir el ticket para que nos importe — es la conversación que el analista debe forzar con Finanzas antes de recoger un solo dato.

Comparaciones múltiples y p-hacking

Un peligro silencioso: cada contraste al 5 % es una lotería con un 5 % de falsas alarmas. Si haces muchos contrastes, las falsas alarmas se acumulan.

Ejemplo doméstico: comparar la satisfacción de cada una de las 42 tiendas de NovaMarket contra la media de la cadena, al 5 %. Aunque ninguna tienda fuera realmente distinta, esperaríamos \( 42 \times 0{,}05 \approx 2 \) tiendas «significativas» por puro azar. La probabilidad de al menos una falsa alarma sería \( 1 - 0{,}95^{42} \approx 0{,}88 \): un 88 %. El titular «Sevilla-Nervión destaca significativamente» estaría casi garantizado… y probablemente vacío.

A la versión deliberada de este fenómeno se la llama p-hacking: probar muchas variantes (segmentos, métricas, ventanas temporales, quitar «atípicos») hasta que algo cruce el 0,05, y publicar solo eso. No hace falta mala fe — basta el entusiasmo de «sigue buscando, que algo saldrá». Defensas básicas:

  • Prerregistrar la hipótesis, la métrica y el análisis antes de mirar los datos (como fijamos la dirección del contraste en la lección anterior).
  • Distinguir análisis confirmatorio (la hipótesis pactada) de exploratorio (todo lo demás: legítimo, pero se etiqueta como generador de hipótesis y se reconfirma con datos nuevos).
  • Si haces muchas comparaciones, ajusta el criterio (la corrección más simple, Bonferroni, reparte α entre los contrastes: con 42 tiendas, exigir p < 0,05/42 ≈ 0,0012). El tratamiento serio de comparar muchos grupos a la vez llega con el ANOVA en la lección Análisis de Varianza.

La ética de la honestidad estadística

Cerramos el módulo con lo que convierte la técnica en profesión. Quien domina la inferencia puede, con los mismos datos, fabricar el titular que quiera: elegir el contraste a posteriori, cortar la muestra donde conviene, callar los análisis que no salieron. Un analista honesto se obliga a lo contrario:

  • Decidir antes de mirar: hipótesis, α, métrica y tamaño muestral se fijan por adelantado; los cambios sobre la marcha se declaran.
  • Reportarlo todo: el efecto con su intervalo (no solo el p), los análisis que no salieron significativos, el número de comparaciones intentadas y las limitaciones de la muestra (los sesgos del Módulo 1 no los cura ningún valor p).
  • No confundir al que decide: traducir a euros y puntos, distinguir «no detectado» de «no existe», y resistir la presión de «encuéntrame un p < 0,05 para el comité».

La credibilidad del equipo de análisis es su único activo real: se construye informe a informe y se pierde con un solo titular inflado. Como resume Marta: «prefiero un "no lo sabemos aún, necesitamos 7.250 por grupo" a un "¡funciona!" que se desmorone en el despliegue».

Errores Comunes y Consejos

  • Confundir los tipos de error. Truco mnemotécnico: tipo I = falsa alarma (rechazas sin razón; su probabilidad es la α que tú fijas); tipo II = incendio no detectado (no rechazas debiendo; probabilidad β).
  • Creer que β es fijo. La potencia siempre es «potencia para detectar un efecto de tamaño tal»; exige preguntar «¿potencia contra qué efecto?» en cualquier estudio que te presenten.
  • Interpretar «no significativo» sin mirar la potencia. Con potencia baja, un p > 0,05 no dice casi nada — el estudio no podía detectar el efecto ni aunque existiera. Antes de archivar una idea, comprueba con qué potencia se testó.
  • Redondear n hacia abajo o olvidar el peor caso en proporciones. El n calculado es un mínimo: siempre techo. Y sin estimación previa de p, usa 0,5.
  • Dimensionar para el efecto esperado en vez del mínimo relevante. El piloto no se diseña para el efecto que sueñas (+3 €) sino para el mínimo que justificaría actuar (+1 €); si no, un resultado «no significativo» no te dejará distinguir «no llega al umbral» de «no lo pudimos ver».
  • Mirar veinte cortes y reportar el que salió. Si has probado 20 segmentos, uno saldrá significativo por azar casi seguro. Declara cuántas comparaciones hiciste o ajusta el criterio.

Ejercicios

Ejercicio 1. El control de calidad de NovaMarket contrasta cada lote de fruta (\( H_0 \): el lote cumple la norma) con α = 0,05. (a) Describe en palabras del negocio el error tipo I y el tipo II de este contraste y quién «paga» cada uno. (b) Si el proveedor es nuevo y hay dudas serias sobre su fiabilidad, ¿moverías α hacia 0,01 o hacia 0,10? Razónalo con la balanza α↔β.

Ejercicio 2. RR. HH. quiere estimar la proporción de empleados interesados en el nuevo plan de turnos con un margen de ±4 % al 95 %, sin ninguna estimación previa. (a) Calcula el n necesario. (b) Un directivo objeta: «somos 6.000 empleados, no los 380.000 del Club Nova; necesitaremos muchos menos». ¿Tiene razón?

Ejercicio 3. Para el piloto de cupones, Finanzas cambia el efecto mínimo relevante de 1 € a 1,50 €, manteniendo α = 0,05 (bilateral), potencia 0,80 y σ = 21,50 €. Recalcula el n por grupo y explica por qué el resultado no es «dos tercios» del original.

Soluciones

Solución 1. (a) Tipo I: rechazar un lote que en realidad cumplía la norma — falsa alarma; lo paga la empresa (fruta desperdiciada, conflicto con el proveedor). Tipo II: aceptar un lote defectuoso — incendio no detectado; lo pagan el cliente y la marca (reclamaciones, riesgo sanitario). (b) Hacia 0,10: con un proveedor dudoso, el error caro es el tipo II, así que conviene un detector más sensible — más falsas alarmas a cambio de que se cuele menos fruta mala; α = 0,01 haría justo lo contrario. Error frecuente: pensar que «más exigente» (α menor) siempre protege más; protege contra el tipo I, pero desprotege contra el tipo II.

Solución 2. (a) \( n = \dfrac{1{,}96^{2} \times 0{,}25}{0{,}04^{2}} = \dfrac{0{,}9604}{0{,}0016} = 600{,}25 \Rightarrow n = 601 \). (b) No: el n depende del margen, la confianza y \( p(1-p) \), no del tamaño de la población — 601 respuestas dan ±4 % igual para 6.000 que para 380.000 (la corrección por población finita apenas rebajaría la cifra aquí, y solo importa al muestrear una fracción grande de la población). Error frecuente: dividir n en proporción al tamaño poblacional; la precisión la da la cuchara, no la olla.

Solución 3. \( n = \dfrac{2 \times (1{,}96 + 0{,}84)^{2} \times 21{,}50^{2}}{1{,}50^{2}} = \dfrac{7.248{,}1}{2{,}25} \approx 3.221 \Rightarrow \) unos 3.225 socios por grupo (~6.450 en total). No es dos tercios de 7.250 sino menos de la mitad, porque \( \Delta \) entra al cuadrado en el denominador: relajar el efecto detectable un 50 % divide la muestra por \( 1{,}5^{2} = 2{,}25 \). Error frecuente: escalar linealmente con \( \Delta \); la relación es cuadrática, y es la razón de que los efectos finos sean tan caros de demostrar.

Conclusión

El módulo de inferencia queda completo. Sabemos estimar parámetros y medir la precisión de la estimación (05-01), envolverla en intervalos con garantías (05-02), someter afirmaciones a contraste con el valor p bien entendido (05-03) y, en esta lección, gestionar los dos errores posibles — falsa alarma (α) e incendio no detectado (β) —, exigir potencia a nuestros estudios y calcular la muestra necesaria: 228 socios para el gasto a ±5 €, los 385 que explican el mítico «~400 para ±5 %» prometido en el Módulo 1, y 7.250 por grupo para que el piloto de cupones pueda detectar el euro que lo hace rentable. Y, sobre todo, hemos aprendido que la honestidad estadística — decidir antes de mirar, reportarlo todo, no torturar los datos — vale más que cualquier fórmula.

Hasta aquí hemos inferido sobre una variable cada vez: una media, una proporción, una diferencia. Pero las preguntas más jugosas de NovaMarket relacionan variables entre sí: ¿venden más las tiendas con más tráfico? ¿sube la satisfacción cuando baja el tiempo de entrega? Medir la fuerza de esas relaciones — y no confundir correlación con causalidad — es el punto de partida del Módulo 6, que arranca con el Análisis de Correlación.

© Copyright 2026. Todos los derechos reservados