En el módulo anterior le dimos la vuelta al catalejo: dejamos de deducir cómo se comportan las muestras a partir de una población conocida y nos preparamos para hacer justo lo contrario — inferir la población a partir de una muestra. Esta lección da el primer paso de ese camino: la estimación de parámetros. Aprenderás qué es un estimador puntual, qué propiedades hacen que un estimador sea «bueno» (insesgadez, eficiencia, consistencia), por qué el error típico mide la calidad de la estimación y qué cambia cuando no conocemos la desviación típica poblacional — momento en el que entra en escena una nueva protagonista: la distribución t de Student. El caso conductor será una pregunta que Marta lleva semanas queriendo responder: ¿cuánto gasta al mes, de media, un socio del Club Nova, y qué proporción de socios está realmente activa?
Contenido
- Del estadístico al estimador: la estimación puntual
- El caso Club Nova: estimando el gasto medio y la proporción de socios activos
- Propiedades deseables de un estimador: insesgadez, eficiencia y consistencia
- La distribución muestral del estimador y el error típico
- Cuando σ es desconocida: la distribución t de Student
- Cómo leer la tabla t
- Otros métodos de estimación (mención)
Del estadístico al estimador: la estimación puntual
Recordemos el vocabulario del Módulo 1:
- Un parámetro es una característica numérica de la población: la media poblacional \( \mu \), la proporción poblacional \( p \), la varianza poblacional \( \sigma^2 \). Casi nunca lo conocemos.
- Un estadístico es una característica numérica de la muestra: la media muestral \( \bar{x} \), la proporción muestral \( \hat{p} \), la varianza muestral \( s^2 \). Siempre podemos calcularlo.
Cuando usamos un estadístico para aproximar un parámetro, lo llamamos estimador, y al valor concreto que toma en nuestra muestra, estimación puntual. Es «puntual» porque es un único número: nuestro mejor pronóstico del parámetro desconocido.
| Parámetro (desconocido) | Estimador habitual | Fórmula |
|---|---|---|
| Media poblacional \( \mu \) | Media muestral | \( \bar{x} = \dfrac{1}{n}\sum_{i=1}^{n} x_i \) |
| Proporción poblacional \( p \) | Proporción muestral | \( \hat{p} = \dfrac{\text{nº de éxitos}}{n} \) |
| Varianza poblacional \( \sigma^2 \) | Varianza muestral | \( s^2 = \dfrac{1}{n-1}\sum_{i=1}^{n} (x_i - \bar{x})^2 \) |
Fíjate en un matiz importante de notación: el estimador es una regla de cálculo (una variable aleatoria, porque su valor depende de la muestra que salga), mientras que la estimación es el número que obtenemos con una muestra concreta. Esta distinción, que parece pedante, es la clave de toda la inferencia.
El caso Club Nova: estimando el gasto medio y la proporción de socios activos
El Club Nova es el programa de fidelización de NovaMarket, con unos 380.000 socios en toda España. Marta plantea dos preguntas al equipo:
- ¿Cuál es el gasto medio mensual de un socio? (parámetro: \( \mu \), en euros)
- ¿Qué proporción de socios está activa? — definiendo «activo» como haber comprado al menos una vez en los últimos 90 días (parámetro: \( p \))
Cruzar los 380.000 historiales completos con los sistemas de facturación es un proyecto de meses; una muestra bien hecha da la respuesta en días. El equipo extrae dos muestras aleatorias simples de la base de socios:
Muestra A (gasto): \( n = 60 \) socios, revisando sus tickets del último mes:
\[ \bar{x} = 126{,}40 ; \text{€} \qquad s = 38{,}50 ; \text{€} \]
Muestra B (actividad): \( n = 150 \) socios, comprobando si compraron en los últimos 90 días: 96 lo hicieron.
\[ \hat{p} = \frac{96}{150} = 0{,}64 \]
Las estimaciones puntuales son, por tanto: «el gasto medio mensual de un socio del Club Nova es de unos 126,40 €» y «el 64 % de los socios está activo».
¿Podemos afirmar que \( \mu = 126{,}40 \) exactamente? No. Si repitiéramos el muestreo mañana con otros 60 socios, saldría otra media — quizá 122,80 €, quizá 131,10 €. La estimación puntual es el mejor pronóstico, pero necesita ir acompañada de una medida de su precisión. De eso se ocupa el resto de la lección (y, de forma definitiva, la siguiente).
Propiedades deseables de un estimador: insesgadez, eficiencia y consistencia
¿Por qué usamos \( \bar{x} \) para estimar \( \mu \) y no, por ejemplo, la mediana muestral, o la media de los 10 primeros datos? Porque los buenos estimadores cumplen tres propiedades. Vamos a entenderlas con intuición, sin demostraciones.
Insesgadez: acertar «de media»
Un estimador es insesgado si, promediando sobre todas las muestras posibles, su valor esperado coincide con el parámetro:
\[ E(\hat{\theta}) = \theta \]
Piensa en un tirador de dardos: puede fallar en cada tiro, pero si sus dardos se reparten centrados en la diana, no tiene sesgo. Si sistemáticamente se desvía hacia la izquierda, sí lo tiene.
- \( \bar{x} \) es insesgado para \( \mu \): unas muestras dan de más y otras de menos, pero no hay desviación sistemática.
- \( \hat{p} \) es insesgado para \( p \), por la misma razón.
- Y aquí se resuelve por fin el misterio del n − 1 que arrastramos desde el Módulo 2: si dividiéramos por \( n \) al calcular la varianza muestral, obtendríamos un estimador sesgado a la baja de \( \sigma^2 \). La razón intuitiva: medimos las desviaciones respecto a \( \bar{x} \), que es el centro de nuestra muestra, y los datos siempre están más cerca de su propio centro que del centro verdadero \( \mu \). Dividir por \( n - 1 \) en lugar de \( n \) «infla» ligeramente el resultado y corrige exactamente ese déficit. Por eso \( s^2 \) con \( n - 1 \) es el estimador estándar de \( \sigma^2 \).
Eficiencia: fallar poco
Entre dos estimadores insesgados, es más eficiente el que tiene menor varianza — es decir, el que se dispersa menos alrededor del parámetro. Volviendo al tirador: dos tiradores centrados en la diana, pero uno agrupa los dardos en un círculo pequeño y el otro los desparrama. Preferimos al primero.
Ejemplo clásico: en una población normal, tanto la media muestral como la mediana muestral son estimadores insesgados de \( \mu \), pero la mediana tiene aproximadamente un 25 % más de error típico. Con los mismos 60 socios del Club Nova, estimar el gasto con la mediana sería como tirar parte de la información a la papelera. Por eso el estimador «oficial» de \( \mu \) es \( \bar{x} \) (aunque, como vimos en el Módulo 2, la mediana sigue siendo valiosa como descriptivo cuando hay asimetría o atípicos).
Consistencia: mejorar con más datos
Un estimador es consistente si, al crecer \( n \), se aproxima cada vez más al parámetro (su error tiende a cero). Es la propiedad de mínimos que exigiríamos: «si me das toda la población, acierta exactamente».
\( \bar{x} \), \( \hat{p} \) y \( s^2 \) son consistentes. La consecuencia práctica ya la conoces del Teorema Central del Límite: el error típico lleva \( \sqrt{n} \) en el denominador, así que más muestra = más precisión (aunque con rendimientos decrecientes: para duplicar la precisión hay que cuadruplicar la muestra).
| Propiedad | Pregunta que responde | Analogía del tirador |
|---|---|---|
| Insesgadez | ¿Acierta de media? | Dardos centrados en la diana |
| Eficiencia | ¿Falla poco? | Dardos muy agrupados |
| Consistencia | ¿Mejora con más datos? | Con más tiros, el promedio clava la diana |
La distribución muestral del estimador y el error típico
Aquí retomamos el gran resultado del Módulo 4. La media muestral \( \bar{X} \) es una variable aleatoria y, por el Teorema Central del Límite, con \( n \) suficientemente grande:
\[ \bar{X} \sim N!\left(\mu, ; \frac{\sigma}{\sqrt{n}}\right) \]
Esa desviación típica de la distribución muestral, \( \sigma / \sqrt{n} \), es el error típico: mide cuánto «baila» el estimador de muestra en muestra. Es la unidad natural para juzgar la precisión de una estimación puntual.
Apliquémoslo al gasto del Club Nova. No conocemos \( \sigma \), así que usamos su estimación \( s = 38{,}50 \):
\[ \widehat{ET}(\bar{x}) = \frac{s}{\sqrt{n}} = \frac{38{,}50}{\sqrt{60}} = \frac{38{,}50}{7{,}746} \approx 4{,}97 ; \text{€} \]
Interpretación: si repitiéramos el muestreo muchas veces, las medias muestrales se desviarían típicamente unos 5 € del gasto medio verdadero. Nuestra estimación de 126,40 € tiene, por tanto, una imprecisión del orden de ±5 € (por cada «paso» de error típico).
Para la proporción, el error típico es \( \sqrt{p(1-p)/n} \), que estimamos con \( \hat{p} \):
\[ \widehat{ET}(\hat{p}) = \sqrt{\frac{0{,}64 \times 0{,}36}{150}} = \sqrt{0{,}001536} \approx 0{,}0392 \]
Es decir, el 64 % estimado baila unos ±3,9 puntos porcentuales por cada error típico. Compara con los dos errores típicos que ya calculamos en el módulo anterior y que reutilizaremos constantemente: el de la satisfacción media (8,1 con ET ≈ 0,063) y el de la proporción de pago con tarjeta (0,61 con ET = 0,0345 para \( n = 200 \)).
Cuando σ es desconocida: la distribución t de Student
En el Módulo 4 trabajamos con un lujo que en la práctica casi nunca tenemos: conocer \( \sigma \). Al tipificar la media muestral hacíamos
\[ Z = \frac{\bar{X} - \mu}{\sigma / \sqrt{n}} \sim N(0,1) \]
Pero en el caso Club Nova hemos sustituido \( \sigma \) por \( s \), que es a su vez una estimación con su propio error. Al hacer esa sustitución, el cociente
\[ T = \frac{\bar{X} - \mu}{s / \sqrt{n}} \]
ya no sigue exactamente una normal: tiene algo más de incertidumbre, porque el denominador también fluctúa de muestra en muestra. Su distribución exacta (cuando la población es aproximadamente normal) la dedujo W. S. Gosset — que publicaba bajo el seudónimo «Student» mientras trabajaba en la cervecera Guinness — y se llama distribución t de Student.
Características de la t:
- Tiene forma de campana, simétrica y centrada en 0, como la normal estándar, pero con colas más pesadas: los valores alejados de 0 son más probables. Es la forma matemática de decir «como no conozco σ, me curo en salud».
- Depende de un parámetro llamado grados de libertad (gl). Para la media de una muestra, \( \text{gl} = n - 1 \) (los mismos \( n-1 \) del denominador de \( s^2 \): de las \( n \) desviaciones respecto a \( \bar{x} \), solo \( n-1 \) son libres, porque suman cero).
- A medida que crecen los grados de libertad, la t se parece cada vez más a la N(0,1). Con gl ≥ 30 son muy similares; con gl ≥ 100, casi indistinguibles. Tiene lógica: con mucha muestra, \( s \) estima muy bien a \( \sigma \) y la corrección apenas hace falta.
| Grados de libertad | Valor que deja un 2,5 % en la cola derecha | Comparación |
|---|---|---|
| 5 | 2,571 | Muy por encima de 1,96 |
| 11 | 2,201 | |
| 24 | 2,064 | |
| 59 | 2,001 | Ya casi 1,96 |
| ∞ (= normal) | 1,960 | La referencia del Módulo 4 |
Regla práctica: para inferencias sobre una media con \( \sigma \) desconocida (es decir, casi siempre), usa la t con \( n - 1 \) grados de libertad. Con muestras grandes, t y z dan resultados prácticamente idénticos, pero usar la t nunca es incorrecto.
Cómo leer la tabla t
La tabla t se organiza de forma distinta a la tabla Z, y conviene dominarla porque la usaremos en las tres próximas lecciones:
- La tabla Z (Módulo 4) da, para cada valor de z, la probabilidad acumulada \( P(Z \le z) \): entras por el valor y sales con la probabilidad.
- La tabla t funciona al revés: entras por la probabilidad y sales con el valor. Como hay una curva t distinta para cada gl, la tabla solo recoge los valores críticos de las probabilidades de cola más usadas.
Estructura típica:
- Filas: grados de libertad (1, 2, 3, …, 30, 40, 60, 120, ∞).
- Columnas: área en la cola derecha (0,10; 0,05; 0,025; 0,01; 0,005).
- Celda: el valor \( t \) que deja exactamente esa área a su derecha, denotado \( t_{\alpha,,\text{gl}} \).
Ejemplo de lectura paso a paso. Queremos el valor t que deja el 2,5 % en la cola derecha con la muestra de gasto del Club Nova (\( n = 60 \), luego gl = 59):
- Busca la fila gl = 59 (si tu tabla salta de 40 a 60, usa gl = 60 o interpola; por prudencia se suele tomar la fila inferior más cercana, aquí daría casi lo mismo).
- Busca la columna «cola derecha = 0,025».
- La celda da \( t_{0{,}025,,59} \approx 2{,}001 \).
Por simetría, el valor que deja el 2,5 % en la cola izquierda es −2,001, y entre −2,001 y +2,001 queda el 95 % central. Compara: con la normal ese papel lo hacía 1,96. Con gl = 11, en cambio, \( t_{0{,}025,,11} = 2{,}201 \) — la penalización por muestra pequeña es visible.
Dos avisos al usar la tabla:
- Algunas tablas rotulan las columnas con el área de dos colas (0,05 en vez de 0,025). Comprueba siempre el dibujo de la cabecera.
- La última fila (gl = ∞) reproduce los valores z conocidos: 1,282; 1,645; 1,960; 2,326; 2,576. Es un buen autochequeo.
Otros métodos de estimación (mención)
¿De dónde salen los estimadores? Dos fábricas clásicas que solo dejamos nombradas: el método de los momentos construye estimadores igualando los momentos muestrales (media, varianza…) a los teóricos de la distribución, y el método de máxima verosimilitud elige como estimación el valor del parámetro que hace más probable haber observado exactamente la muestra que tenemos. Para los casos de este curso (\( \mu \), \( p \), \( \sigma^2 \)), ambos conducen esencialmente a los estimadores que ya usamos, así que no los desarrollaremos.
Errores Comunes y Consejos
- Confundir estimación con parámetro. Decir «el gasto medio de los socios es 126,40 €» a secas es incorrecto: 126,40 € es la estimación; \( \mu \) sigue siendo desconocido. En informes para dirección, acompaña siempre la cifra de su error típico o (mejor, tras la próxima lección) de un intervalo.
- Usar z cuando toca t. Si \( \sigma \) es desconocida y la muestra no es grande, tipificar con la normal infravalora la incertidumbre. La regla segura: σ desconocida → t con \( n-1 \) gl.
- Equivocarse con las colas de la tabla t. Verifica si tu tabla da área de una cola o de dos. Un 0,05 de una cola equivale a un 0,10 de dos colas; confundirlos cambia el valor crítico (1,671 frente a 2,001 con gl = 59, por ejemplo).
- Creer que insesgado = exacto. Un estimador insesgado puede fallar mucho en una muestra concreta; solo garantiza que no falla sistemáticamente en la misma dirección.
- Olvidar el origen del n − 1. Si te preguntan en una reunión, la respuesta corta es: «dividir por n subestimaría la varianza, porque los datos siempre están más cerca de su propia media que de la media verdadera; n − 1 lo corrige».
Ejercicios
Ejercicio 1. De la muestra B (150 socios, 96 activos): (a) da la estimación puntual de la proporción de socios inactivos; (b) calcula su error típico estimado; (c) razona si es el mismo que el de \( \hat{p} = 0{,}64 \) y por qué.
Ejercicio 2. El equipo de Marta se plantea ampliar la muestra de gasto de 60 a 240 socios. Suponiendo que \( s \) se mantuviera en 38,50 €, ¿cuál sería el nuevo error típico de la media? ¿Qué propiedad del estimador ilustra este resultado?
Ejercicio 3. Con una muestra piloto de \( n = 12 \) socios de la tienda de Cuenca se quiere tipificar la media usando \( s \). (a) ¿Qué distribución debe usarse y con cuántos grados de libertad? (b) Busca en la tabla el valor que deja un 2,5 % en la cola derecha. (c) Compáralo con 1,96 y explica en una frase por qué es mayor.
Soluciones
Solución 1. (a) \( \hat{q} = 1 - 0{,}64 = 0{,}36 \) (o directamente 54/150). (b) \( \widehat{ET} = \sqrt{0{,}36 \times 0{,}64 / 150} = \sqrt{0{,}001536} \approx 0{,}0392 \). (c) Es exactamente el mismo, porque \( p(1-p) = (1-p)p \): la incertidumbre sobre «activos» y sobre «inactivos» es la misma información vista desde los dos lados. Error frecuente: recalcular con \( 0{,}36 \times 0{,}36 \) — la fórmula lleva \( \hat{p}(1-\hat{p}) \), no \( \hat{p}^2 \).
Solución 2. \( \widehat{ET} = 38{,}50/\sqrt{240} = 38{,}50/15{,}49 \approx 2{,}49 \) €, la mitad del original (4,97 €). Cuadruplicar la muestra divide el error típico por \( \sqrt{4} = 2 \). Ilustra la consistencia: más datos, estimación más precisa — pero con rendimientos decrecientes (×4 de coste para ×2 de precisión). Error frecuente: esperar que el error se divida por 4; la raíz cuadrada lo impide.
Solución 3. (a) La t de Student con gl \( = 12 - 1 = 11 \), porque \( \sigma \) es desconocida y la muestra es pequeña. (b) \( t_{0{,}025,,11} = 2{,}201 \). (c) Es mayor que 1,96 porque la t tiene colas más pesadas: al estimar \( \sigma \) con solo 12 datos añadimos incertidumbre, y el valor crítico se ensancha para compensarla. Error frecuente: usar gl = 12; los grados de libertad son \( n - 1 \).
Conclusión
Hemos dado el primer paso de la inferencia: usar estadísticos muestrales como estimadores puntuales de los parámetros (\( \bar{x} \to \mu \), \( \hat{p} \to p \), \( s^2 \to \sigma^2 \)), exigirles buenas propiedades — insesgadez (el porqué del n − 1), eficiencia y consistencia — y medir su precisión con el error típico. Y hemos conocido la t de Student, la campana de colas anchas que sustituye a la normal cuando \( \sigma \) se estima con \( s \), junto con su tabla y sus grados de libertad.
Pero una estimación puntual con su error típico es una respuesta a medias: Marta no quiere oír «126,40 € con un baile de unos 5 €», sino algo como «entre tanto y tanto, con un 95 % de confianza». Convertir el error típico en una horquilla con garantías — y responder por fin a la pregunta que el comité dejó en el aire sobre el 8,1 de satisfacción — es el objetivo de la próxima lección: los Intervalos de Confianza.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
