En esta primera lección vas a descubrir qué es realmente la estadística y por qué se ha convertido en una competencia imprescindible en el mundo profesional. Lejos de ser una colección de fórmulas abstractas, la estadística es el conjunto de métodos que nos permite transformar datos en decisiones. Aprenderás la diferencia entre describir datos e inferir conclusiones, entenderás qué son una población y una muestra, y distinguirás entre parámetros y estadísticos. Además, conocerás a NovaMarket, la empresa (ficticia) en la que trabajarás como analista de datos durante todo el curso: todos los ejemplos y ejercicios girarán en torno a sus datos.
Contenido
- Bienvenido a NovaMarket: tu puesto de trabajo durante este curso
- ¿Qué es la estadística y para qué sirve en la empresa?
- Estadística descriptiva y estadística inferencial
- Población y muestra
- Parámetro y estadístico
- Unidades de análisis y observaciones
Bienvenido a NovaMarket: tu puesto de trabajo durante este curso
Imagina que hoy es tu primer día como analista de datos en las oficinas centrales de NovaMarket, una cadena española de supermercados con:
- 42 tiendas físicas repartidas por todo el país.
- Una tienda online con reparto a domicilio.
- Un programa de fidelización llamado «Club Nova», con cientos de miles de clientes registrados.
- Campañas promocionales periódicas (folletos, descuentos, cupones personalizados).
Tu responsable directa es Marta, directora de análisis. Marta recibe preguntas de toda la organización y las convierte en encargos para tu equipo. Algunos ejemplos reales del tipo de peticiones que llegan cada semana:
| Quién pregunta | Pregunta de negocio | ¿Qué necesita la estadística para responder? |
|---|---|---|
| Dirección comercial | «¿Qué tienda vende más por metro cuadrado?» | Resumir y comparar datos de ventas |
| Marketing | «¿La campaña de septiembre aumentó el ticket medio?» | Comparar datos antes/después y decidir si la diferencia es real o casualidad |
| Logística | «¿Cuánto tarda de media una entrega online y cuánto varía?» | Medir el centro y la variabilidad de los tiempos |
| Atención al cliente | «¿Están satisfechos los socios del Club Nova?» | Diseñar una encuesta y generalizar sus resultados |
| Finanzas | «¿Cuántas ventas prevemos para diciembre?» | Analizar la evolución temporal y proyectarla |
Fíjate en algo importante: ninguna de estas preguntas menciona la palabra "estadística", pero todas necesitan estadística para responderse con rigor. Ese es exactamente tu trabajo: traducir preguntas de negocio a preguntas de datos, y respuestas de datos a decisiones de negocio.
A lo largo del curso, Marta te irá planteando encargos de dificultad creciente. En este módulo empezamos por lo más básico: entender el lenguaje de la estadística.
¿Qué es la estadística y para qué sirve en la empresa?
La estadística es la ciencia que se ocupa de recoger, organizar, resumir, analizar e interpretar datos para extraer conclusiones y apoyar la toma de decisiones en condiciones de incertidumbre.
Desglosemos esa definición, porque cada verbo corresponde a una fase del trabajo real de un analista:
- Recoger: obtener los datos (tickets de compra, encuestas, registros de entregas…). Lo veremos en la lección Recolección de Datos y Muestreo.
- Organizar: estructurar los datos en tablas limpias y coherentes.
- Resumir: reducir miles de números a unos pocos indicadores comprensibles (medias, porcentajes, gráficos). Es el objeto del Módulo 2.
- Analizar: buscar patrones, relaciones y diferencias.
- Interpretar: responder a la pregunta de negocio original, indicando además cuánta confianza merece la respuesta.
La última parte de la definición — en condiciones de incertidumbre — es la clave que distingue a la estadística de la simple contabilidad. En NovaMarket casi nunca tendrás todos los datos que te gustaría:
- No puedes encuestar a los 380.000 socios del Club Nova; encuestarás a unos miles.
- No puedes saber cuánto venderá la tienda de Zaragoza el mes que viene; solo puedes estimarlo.
- No puedes observar a todos los clientes potenciales de España; solo a los que ya compran.
La estadística te da herramientas para decir cosas razonables sobre lo que no ves a partir de lo que sí ves, y para cuantificar el riesgo de equivocarte.
¿Por qué es importante para un profesional no técnico?
Aunque nunca llegues a calcular nada a mano en tu trabajo, entender estadística te permite:
- Hacer mejores preguntas: «¿ese aumento del 3 % es relevante o entra dentro de la variación normal?».
- Detectar conclusiones precipitadas: un informe que compara dos tiendas con datos de una sola semana probablemente no demuestra nada.
- Comunicar con rigor: distinguir entre «las ventas subieron» y «las ventas subieron en la muestra que analizamos, con tal margen de error».
- Dialogar con perfiles técnicos: entender qué te está contando (y qué no) un científico de datos o una herramienta de business intelligence.
Estadística descriptiva y estadística inferencial
La estadística se divide tradicionalmente en dos grandes ramas. Entender la diferencia es fundamental porque determina qué puedes afirmar legítimamente con tus datos.
Estadística descriptiva
La estadística descriptiva organiza y resume los datos que ya tienes, sin pretender ir más allá de ellos. Responde a preguntas del tipo «¿cómo son estos datos?».
Ejemplo en NovaMarket: Marta te pide un informe sobre las ventas de ayer en las 42 tiendas. Tienes el dato exacto de cada tienda, así que puedes calcular:
- La venta total del día: 1.847.300 €.
- La venta media por tienda: \( 1.847.300 / 42 \approx 43.983 \) €.
- La tienda con más ventas (Madrid-Centro, 91.200 €) y la de menos (Cuenca, 18.400 €).
Aquí no hay incertidumbre: describes exactamente lo que ocurrió. No estás estimando nada; estás resumiendo.
Estadística inferencial
La estadística inferencial utiliza los datos de una parte (una muestra) para sacar conclusiones sobre el todo (la población), acompañando cada conclusión de una medida de su fiabilidad. Responde a preguntas del tipo «¿qué puedo concluir sobre lo que no he observado?».
Ejemplo en NovaMarket: Marta quiere saber la satisfacción de todos los socios del Club Nova, pero solo habéis encuestado a 1.200. Si en la encuesta la satisfacción media es de 7,8 sobre 10, la inferencia estadística te permite afirmar algo como: «la satisfacción media de todos los socios está, con alta confianza, entre 7,6 y 8,0». Ese salto — de 1.200 encuestados a 380.000 socios — es una inferencia, y hacerla bien es el objeto de los Módulos 3 a 5.
Comparación de las dos ramas
| Aspecto | Descriptiva | Inferencial |
|---|---|---|
| Pregunta que responde | ¿Cómo son mis datos? | ¿Qué concluyo sobre lo que no observé? |
| Datos que usa | Todos los disponibles | Una muestra de la población |
| ¿Hay incertidumbre en la conclusión? | No (describe hechos) | Sí (y se cuantifica) |
| Herramientas típicas | Medias, porcentajes, tablas, gráficos | Estimaciones, intervalos de confianza, pruebas de hipótesis |
| Ejemplo NovaMarket | «El ticket medio de ayer fue de 32,40 €» | «El ticket medio anual de todos los clientes está entre 30 € y 34 €» |
| Módulos del curso | Módulo 2 | Módulos 3, 4 y 5 |
Un error muy frecuente en la empresa es presentar resultados descriptivos de una muestra como si fueran conclusiones sobre toda la población, sin ninguna medida de incertidumbre. Este curso te enseñará a no caer en esa trampa.
Población y muestra
Estos dos conceptos son la columna vertebral de toda la estadística inferencial.
- Población: el conjunto completo de elementos sobre los que queremos concluir algo. No tiene por qué ser gente: puede ser tickets, entregas, productos o tiendas.
- Muestra: el subconjunto de la población que realmente observamos o medimos.
\[ \text{Muestra} \subset \text{Población} \]
La población la define la pregunta de negocio, no los datos que tengas a mano. Veámoslo con encargos reales de Marta:
| Encargo de Marta | Población | Posible muestra |
|---|---|---|
| «¿Están satisfechos los socios del Club Nova?» | Los 380.000 socios del club | 1.200 socios encuestados |
| «¿Cuánto tardan nuestras entregas online?» | Todas las entregas del e-commerce en 2026 | 500 entregas elegidas al azar |
| «¿Qué peso tiene la marca propia en el ticket?» | Todos los tickets del año | 10.000 tickets seleccionados |
| «¿Cuál fue la venta media por tienda ayer?» | Las 42 tiendas | Las 42 tiendas (¡población completa!) |
Fíjate en el último caso: cuando puedes observar la población entera (solo hay 42 tiendas y tienes el dato de todas), no necesitas inferir nada; basta con describir. A eso se le llama trabajar con un censo. En la lección Recolección de Datos y Muestreo veremos cuándo compensa un censo y cuándo una muestra, y cómo elegir bien esa muestra.
¿Por qué trabajar con muestras?
Porque observar la población completa suele ser:
- Caro: encuestar a 380.000 socios costaría una fortuna.
- Lento: para cuando terminaras, los resultados estarían obsoletos.
- Imposible: la población puede incluir elementos futuros (las entregas del resto del año aún no existen).
- Innecesario: una muestra bien elegida de unos pocos miles puede dar resultados casi tan precisos como el censo.
La contrapartida es que la muestra introduce incertidumbre: otra muestra habría dado números ligeramente distintos. Gestionar esa incertidumbre es, precisamente, el trabajo de la estadística inferencial.
Parámetro y estadístico
Cuando calculamos un valor resumen (una media, un porcentaje…), el nombre que recibe depende de sobre qué se calcula:
- Parámetro: valor calculado sobre la población completa. Suele ser desconocido (por eso muestreamos) y se representa con letras griegas: \( \mu \) (media poblacional), \( \sigma \) (desviación típica poblacional), \( \pi \) o \( p \) (proporción poblacional).
- Estadístico: valor calculado sobre la muestra. Es conocido (lo calculas tú con tus datos) y se representa con letras latinas: \( \bar{x} \) (media muestral), \( s \) (desviación típica muestral), \( \hat{p} \) (proporción muestral).
La relación entre ambos es el corazón de la inferencia:
\[ \underbrace{\bar{x}}{\text{estadístico (conocido)}} ; \longrightarrow ; \text{estima} ; \longrightarrow ; \underbrace{\mu}{\text{parámetro (desconocido)}} \]
Ejemplo trabajado paso a paso
Marta quiere saber el gasto medio mensual de todos los socios del Club Nova (ese es el parámetro \( \mu \), desconocido). Como no es viable analizarlos todos hoy, tomas una muestra de 8 socios al azar y consultas su gasto del último mes:
| Socio | Gasto mensual (€) |
|---|---|
| S-1041 | 210 |
| S-2233 | 145 |
| S-0512 | 320 |
| S-3908 | 95 |
| S-1877 | 260 |
| S-2740 | 180 |
| S-0099 | 155 |
| S-3121 | 235 |
Paso 1. Sumamos los gastos:
\[ 210 + 145 + 320 + 95 + 260 + 180 + 155 + 235 = 1.600 \text{ €} \]
Paso 2. Dividimos entre el número de socios de la muestra (\( n = 8 \)):
\[ \bar{x} = \frac{1.600}{8} = 200 \text{ €} \]
Interpretación. El estadístico \( \bar{x} = 200 \) € es tu mejor estimación del parámetro \( \mu \). Pero ojo: si hubieras elegido otros 8 socios, habrías obtenido otra media (quizá 187 €, quizá 214 €). El valor verdadero de \( \mu \) sigue siendo desconocido; lo que aprenderás en el Módulo 5 es a construir afirmaciones del tipo «\( \mu \) está probablemente entre tal y tal valor». Por ahora, quédate con la distinción:
| Parámetro | Estadístico | |
|---|---|---|
| Se calcula sobre… | La población | La muestra |
| ¿Se conoce su valor? | Normalmente no | Sí |
| Símbolos habituales | \( \mu, \sigma, \pi \) | \( \bar{x}, s, \hat{p} \) |
| ¿Varía si repito el estudio? | No (es un valor fijo) | Sí (cambia con cada muestra) |
Un truco mnemotécnico clásico: P con P y E con E — el Parámetro describe la Población; el Estadístico se extrae de la muestra (en inglés, Estimate de la Evidence disponible).
Unidades de análisis y observaciones
Antes de calcular nada, un analista debe tener clarísimo qué representa cada fila de sus datos. Aquí entran dos conceptos:
- Unidad de análisis (o unidad estadística): el tipo de elemento individual que estudias — un cliente, un ticket, una tienda, una entrega.
- Observación: los datos registrados para una unidad concreta; en una tabla, cada observación es una fila.
Sobre cada unidad se miden una o varias características (el importe del ticket, la provincia de la tienda…). Esas características son las variables, y ocupan las columnas de la tabla; las estudiaremos en detalle en la próxima lección, Tipos de Datos.
Por qué importa tanto
La misma pregunta cambia de respuesta según la unidad de análisis elegida. Supón que Marta pregunta: «¿cuál es nuestro importe medio?».
- Si la unidad es el ticket: sumas todos los importes de los tickets y divides entre el número de tickets. Obtienes el ticket medio (por ejemplo, 32,40 €).
- Si la unidad es el cliente: sumas el gasto total de cada cliente en el mes y divides entre el número de clientes. Obtienes el gasto medio por cliente (por ejemplo, 187 €).
- Si la unidad es la tienda: obtienes la venta media por tienda (por ejemplo, 43.983 € diarios).
Los tres números son correctos, pero responden a preguntas distintas. Parte del oficio de analista consiste en preguntar a Marta (o a quien haga el encargo): «¿medio por qué: por ticket, por cliente o por tienda?».
Ejemplo: una tabla de datos de NovaMarket
Así podría verse un extracto de la tabla de entregas del e-commerce, donde la unidad de análisis es la entrega:
| ID entrega | Fecha | Provincia | Importe (€) | Tiempo de entrega (h) |
|---|---|---|---|---|
| E-70012 | 2026-08-14 | Madrid | 64,90 | 21,5 |
| E-70013 | 2026-08-14 | Valencia | 38,20 | 26,0 |
| E-70014 | 2026-08-15 | Sevilla | 51,75 | 44,5 |
- Cada fila es una observación (una entrega concreta).
- Cada columna es una variable medida sobre esa entrega.
- Si esta tabla contiene 500 entregas de las 120.000 del año, es una muestra; las 120.000 son la población.
Errores Comunes y Consejos
- Confundir describir con inferir. «El 62 % de los encuestados prefiere la marca propia» no equivale a «el 62 % de nuestros clientes prefiere la marca propia». Lo primero es descripción de la muestra; lo segundo es una inferencia que exige métodos (y cautelas) que veremos más adelante.
- Definir mal la población. Si encuestas solo a socios del Club Nova, tu población es «los socios», no «todos los clientes de NovaMarket». Los clientes sin tarjeta pueden ser muy distintos.
- Creer que más datos siempre significa población. Tener millones de tickets no implica tener la población: si tu pregunta es sobre el comportamiento futuro de los clientes, incluso todos los tickets pasados son, conceptualmente, una muestra.
- Mezclar unidades de análisis. Comparar el «gasto medio por ticket» de una tienda con el «gasto medio por cliente» de otra es comparar peras con manzanas. Fija siempre la unidad antes de calcular.
- Consejo profesional: cuando recibas un encargo, escribe en una frase la población, la unidad de análisis y qué se quiere saber de ella. Treinta segundos de definición ahorran horas de análisis mal enfocado.
Ejercicios
Ejercicio 1
Marta te reenvía este mensaje del director de logística: «Hemos analizado 400 entregas de julio elegidas al azar y el tiempo medio fue de 28,3 horas. Quiero saber cómo va el servicio de entregas de este año».
- ¿Cuál es la población del estudio?
- ¿Cuál es la muestra?
- El valor 28,3 horas, ¿es un parámetro o un estadístico?
- La afirmación «el tiempo medio de nuestras 400 entregas analizadas fue de 28,3 horas», ¿es descriptiva o inferencial? ¿Y «nuestro servicio entrega en unas 28 horas de media»?
Ejercicio 2
Para cada encargo, indica la unidad de análisis más adecuada:
- «¿Qué porcentaje de tickets incluye al menos un producto de marca propia?»
- «¿Qué antigüedad media tienen los socios del Club Nova?»
- «¿Cuántas tiendas superaron el millón de euros de venta en agosto?»
- «¿Qué proporción de entregas online llega en menos de 24 horas?»
Ejercicio 3
En una reunión, un responsable de marketing afirma: «Hemos preguntado a 50 clientes a la salida de la tienda de Madrid-Centro y al 80 % le gusta el nuevo folleto, así que al 80 % de los clientes de NovaMarket le gusta el nuevo folleto». Señala dos problemas estadísticos de esta afirmación usando los conceptos de la lección.
Soluciones
Solución 1
- Población: todas las entregas del e-commerce de NovaMarket de este año (incluidas las que aún no se han producido, si la pregunta es sobre «el servicio de este año»; como mínimo, todas las de julio si acotamos al mes estudiado).
- Muestra: las 400 entregas de julio analizadas.
- Es un estadístico (\( \bar{x} = 28,3 \) h): está calculado sobre la muestra. El parámetro sería el tiempo medio de todas las entregas, que no conocemos.
- La primera afirmación es descriptiva: habla solo de las 400 entregas observadas y es un hecho exacto. La segunda es inferencial: generaliza a todo el servicio. Error frecuente: darlas por equivalentes; la segunda exige justificar que la muestra es representativa y acompañar el 28 con un margen de error, cosa que aprenderemos a hacer en el Módulo 5.
Solución 2
- El ticket (cada fila es un ticket; se comprueba si contiene marca propia).
- El socio del Club Nova.
- La tienda.
- La entrega.
Error frecuente: en la pregunta 1 muchos responden «el producto» o «el cliente». Fíjate en la formulación: se pregunta por un porcentaje de tickets, así que el elemento que se cuenta (y que forma las filas) es el ticket.
Solución 3
Dos problemas principales (con uno cualquiera de estos dos bien argumentado, la respuesta es válida; lo ideal es ver ambos):
- Salto de descripción a inferencia sin cautelas: el 80 % es un estadístico de la muestra; presentarlo como el valor para «los clientes de NovaMarket» es tratar un estadístico como si fuera el parámetro, sin margen de error alguno (y con solo 50 personas, ese margen sería grande).
- Población mal representada: se encuestó únicamente en una tienda (Madrid-Centro) y solo a quienes salían de comprar. Esa muestra no representa a los clientes de las 42 tiendas ni a los del canal online, por lo que generalizar a «los clientes de NovaMarket» no está justificado. (Veremos cómo se llama y se evita este problema — sesgo de selección — en la lección 01-03.)
Consejo: no hace falta saber aún calcular márgenes de error para detectar estos fallos; basta con preguntarse siempre «¿de qué población hablo y a quién he observado realmente?».
Conclusión
En esta lección has puesto los cimientos de todo el curso. Ya sabes que la estadística sirve para tomar decisiones con datos en condiciones de incertidumbre, y dominas su vocabulario esencial: la descriptiva resume lo observado y la inferencial generaliza a lo no observado; la población es el todo sobre el que quieres concluir y la muestra la parte que observas; el parámetro es el valor poblacional (desconocido, en letras griegas) y el estadístico su estimación muestral (conocida, en letras latinas); y toda tabla de datos se organiza en observaciones (filas) de una unidad de análisis bien definida. También has conocido NovaMarket y a Marta, que seguirá planteándote encargos en cada lección. El siguiente paso es examinar las columnas de esas tablas: en la próxima lección, Tipos de Datos, aprenderás a clasificar las variables y a saber qué operaciones admite cada una — la base para no calcular jamás la «media» de un código postal.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
