Todo el curso has trabajado "a mano": fórmulas, tablas y calculadora. Ha sido deliberado — quien entiende el cálculo entiende el resultado —, pero en el día a día nadie suma 33.000 tickets con lápiz. Esta última lección es el puente al trabajo real: un panorama honesto de las herramientas con las que se hace estadística en una empresa, de la hoja de cálculo (que llega mucho más lejos de lo que se suele creer) a Python y R (que empiezan donde aquella se agota), pasando por el software estadístico clásico y el uso sensato de la IA generativa. Verás el análisis de NovaMarket reproducido con fórmulas de hoja de cálculo, un primer contacto comentado con pandas y scipy, y criterios para elegir herramienta según la tarea. Y, como es la última lección, cierra también el curso: qué camino has recorrido y hacia dónde seguir.
Contenido
- El mapa: qué herramienta para qué tarea
- La hoja de cálculo como primera herramienta seria
- NovaMarket en fórmulas: el curso entero en una hoja
- Tablas dinámicas: frecuencias y cruces sin fórmulas
- Dónde se acaba la hoja de cálculo
- Python con pandas y scipy: el siguiente escalón
- R: el otro gran camino
- Software estadístico clásico: SPSS, Stata, jamovi y JASP
- La IA generativa como asistente de análisis
- Un flujo de trabajo reproducible
- Cierre del curso: el viaje, lo que sabes hacer y los siguientes pasos
El mapa: qué herramienta para qué tarea
No hay una herramienta "mejor": hay emparejamientos mejores o peores entre tarea, volumen de datos y perfil de quien analiza.
| Herramienta | Ideal para | Se queda corta cuando | Curva de aprendizaje |
|---|---|---|---|
| Hoja de cálculo | Descriptivos, IC, pruebas t y chi-cuadrado, gráficos rápidos, datos < ~100.000 filas | Análisis repetibles, datos grandes, métodos avanzados | Baja (ya la usas) |
| jamovi / JASP | Todos los contrastes del curso con menús y salida limpia, gratis | Automatización, datos muy grandes | Baja |
| SPSS / Stata | Lo mismo, estándar en academia y consultoría | Presupuesto (licencias), flexibilidad | Media |
| R | Cualquier método estadístico existente; gráficos de calidad | Quien no quiera programar nada | Media-alta |
| Python (pandas/scipy) | Estadística + automatización + integración con sistemas y ML | Métodos estadísticos muy de nicho (R llega antes) | Media-alta |
La trayectoria natural del profesional de negocio es de arriba abajo: dominar de verdad la hoja de cálculo, probar jamovi/JASP cuando los menús ayuden, y dar el salto a Python o R cuando la repetición o el volumen lo pidan.
La hoja de cálculo como primera herramienta seria
Excel, Google Sheets y LibreOffice Calc comparten (con nombres casi idénticos en español) un arsenal estadístico que cubre la mayor parte de este curso. La tabla siguiente es tu mapa de vuelta: cada función, con la lección donde aprendiste qué significa.
| Función (ES) | Qué calcula | Lección |
|---|---|---|
PROMEDIO, MEDIANA, MODA.UNO |
Tendencia central | 02-01 |
DESVEST.M, VAR.S |
Desviación típica y varianza muestrales (divisor \(n-1\)) | 02-02 |
PERCENTIL.INC, CUARTIL.INC |
Percentiles y cuartiles | 02-03 |
CONTAR.SI, FRECUENCIA |
Frecuencias | 02-04 |
DISTR.BINOM.N, POISSON.DIST |
Probabilidades binomial y Poisson | 04-01, 04-03 |
DISTR.NORM.N, DISTR.NORM.INV |
Probabilidades y percentiles de la normal | 04-02 |
INTERVALO.CONFIANZA.T |
Semiamplitud del IC de la media (t) | 05-02 |
PRUEBA.T, PRUEBA.Z |
Valor p de pruebas t y z | 05-03 |
COEF.DE.CORREL |
Correlación de Pearson | 06-01 |
PENDIENTE, INTERSECCION.EJE, COEFICIENTE.R2, ESTIMACION.LINEAL |
Regresión lineal | 06-02 |
PRUEBA.CHICUAD |
Valor p de chi-cuadrado (observados vs esperados) | 06-04 |
PRONOSTICO.LINEAL, PRONOSTICO.ETS |
Previsión (lineal / alisado con estacionalidad) | 07-01 |
Además, el complemento gratuito Análisis de datos de Excel (Herramientas para análisis) añade ANOVA, regresión múltiple con su salida completa e histogramas — con él, la hoja cubre hasta buena parte del módulo 6 y 7.
NovaMarket en fórmulas: el curso entero en una hoja
Supón la hoja tickets con 500 tickets de Madrid-Centro: importes en A2:A501 y, en B2:B501, el canal (tienda/online). Así se reproduce, fórmula a fórmula, el trabajo del curso:
- Descriptiva (módulo 2):
- Media:
=PROMEDIO(A2:A501)→ 32,40 € - Desviación:
=DESVEST.M(A2:A501)→ 21,50 € (fíjate: la.Mde muestral;DESVEST.Pdividiría entre \(n\) y sería la poblacional) - Mediana y P90:
=MEDIANA(A2:A501),=PERCENTIL.INC(A2:A501;0,9) - CV:
=DESVEST.M(A2:A501)/PROMEDIO(A2:A501)→ 0,66: la enorme dispersión relativa de los tickets, vieja conocida.
- Media:
- Probabilidad (módulo 4): ¿probabilidad de que una tienda venda menos de 40.000 € en un día, con \(N(43,983;\ 6,200)\)?
=DISTR.NORM.N(40000;43983;6200;VERDADERO)→ 0,26. El percentil 95 de la demanda del caso de inventario:=DISTR.NORM.INV(0,95;720;70)→ 835,1. - Inferencia (módulo 5): IC al 95 % para el ticket medio:
- Semiamplitud:
=INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500)→ 1,89 - Intervalo: media ± semiamplitud → \((30{,}51;\ 34{,}29)\) €.
- Semiamplitud:
- Contraste (módulo 5): ¿gastan igual tienda y online? Con los importes de cada canal en
D2:D341yE2:E161:=PRUEBA.T(D2:D341;E2:E161;2;3)→ devuelve directamente el valor p (el2pide contraste bilateral; el3, varianzas distintas — la variante de Welch, la opción prudente por defecto). - Regresión (módulo 6): ventas vs superficie de las 42 tiendas en
G2:H43:=PENDIENTE(H2:H43;G2:G43),=INTERSECCION.EJE(H2:H43;G2:G43),=COEFICIENTE.R2(H2:H43;G2:G43)— y la regresión múltiple del R² = 0,912, con el complemento de análisis o=ESTIMACION.LINEALcon varias columnas de X.
La lección de fondo: todo lo que calculaste a mano en el curso vive a una fórmula de distancia. La hoja no piensa por ti — sigue haciendo falta saber que PRUEBA.T contrasta medias y qué significa su valor p —, pero ejecuta por ti.
Tablas dinámicas: frecuencias y cruces sin fórmulas
Para variables categóricas, la herramienta reina de la hoja es la tabla dinámica: arrastras canal a filas y obtienes la distribución de frecuencias de 02-04; arrastras grupo de edad a columnas y tienes la tabla de contingencia de 06-04 — la del cruce hábitos × edad de la lección de ciencias sociales se monta en 30 segundos. Con "mostrar valores como % de fila" lees los perfiles directamente. Para el contraste, calculas al lado los esperados (total fila × total columna / total) y rematas con PRUEBA.CHICUAD(observados;esperados). Media de importe por segmento y formato, mínimos y máximos por transportista... cualquier "¿cuánto vale X por grupo?" es una tabla dinámica antes que cien fórmulas.
Dónde se acaba la hoja de cálculo
Honestidad obligada; la hoja se agota, y conviene reconocer los síntomas:
- Repetición: el mismo análisis cada semana, con el mismo ritual de copiar-pegar-ajustar-rangos. Cada repetición manual es una oportunidad de error silencioso.
- Volumen: cientos de miles de filas la vuelven lenta e inestable (y los 4,5 millones de tickets mensuales de NovaMarket, sencillamente, no caben).
- Trazabilidad: una celda sobrescrita no deja rastro; auditar quién cambió qué es casi imposible. Errores célebres de hojas de cálculo han costado carreras y presupuestos públicos.
- Métodos: logística, ACP, k-means, Kaplan-Meier, no paramétricos serios... o no existen o exigen contorsiones.
- Mezcla de dato y cálculo: en una hoja, los datos brutos y las fórmulas conviven y se contaminan; los flujos serios los separan.
Ninguno de estos límites invalida la hoja para lo que hace bien: análisis puntuales, tamaños moderados, comunicación. Solo marcan la frontera.
Python con pandas y scipy: el siguiente escalón
Python es hoy el idioma más común del análisis de datos en empresa. Dos bibliotecas bastan para reproducir el curso: pandas (tablas de datos) y scipy.stats (métodos estadísticos). Un primer script completo, línea a línea:
import pandas as pd # pandas: tablas de datos ("DataFrames")
from scipy import stats # scipy.stats: funciones estadísticas
df = pd.read_csv("tickets.csv") # carga el CSV: una fila por ticket
print(df["importe"].describe()) # n, media, desviación, mín, cuartiles, máx
# (todo el módulo 2 en una línea)
media = df["importe"].mean() # media muestral
s = df["importe"].std() # desviación típica muestral (divisor n-1)
n = len(df) # tamaño muestral
ic = stats.t.interval(0.95, df=n - 1, # IC al 95 % con la t de Student:
loc=media, scale=s / n ** 0.5) # centro = media, escala = error estándar
print(f"IC 95%: {ic}") # p. ej. (30.51, 34.29) — como en la hoja
tienda = df[df["canal"] == "tienda"]["importe"] # filtra los tickets de tienda
online = df[df["canal"] == "online"]["importe"] # y los de online
t, p = stats.ttest_ind(tienda, online, equal_var=False) # t de Welch (dos muestras)
print(f"t = {t:.2f}, valor p = {p:.4f}") # el mismo contraste de la lección 05-03Lo importante no es memorizar la sintaxis, sino ver el patrón: cada línea ejecuta algo que ya sabes interpretar. describe() es el módulo 2; t.interval, la lección 05-02; ttest_ind, la 05-03. En scipy viven también chi2_contingency (chi-cuadrado), f_oneway (ANOVA), pearsonr y mannwhitneyu; la regresión múltiple y la logística, en la biblioteca statsmodels; el k-means que segmentó al Club Nova, en scikit-learn. Aprender Python para datos es un curso en sí mismo — aquí basta con que sepas que la puerta existe, que está abierta y que el idioma que se habla al otro lado es el que acabas de aprender.
R: el otro gran camino
R nació para la estadística y sigue siendo el estándar en investigación: cualquier método publicado tiene paquete en R antes que en ningún sitio. El equivalente del script anterior:
tickets <- read.csv("tickets.csv") # cargar los datos
summary(tickets$importe) # descriptivos básicos
t.test(importe ~ canal, # t de Welch e IC del 95 % en una sola
data = tickets) # llamada: fórmula "importe según canal"Elegir entre Python y R importa menos de lo que parece: los conceptos son idénticos y migrar cuesta días, no meses. Orientación práctica: entorno de ingeniería de datos/ML y automatización → Python; entorno académico, bioestadística o gráficos estadísticos finos → R.
Software estadístico clásico: SPSS, Stata, jamovi y JASP
Entre la hoja y la programación hay una tercera vía: programas de menús pensados para estadística.
- SPSS (IBM) y Stata: veteranos de ciencias sociales, salud y consultoría; salidas completas y documentadas, pero licencias caras.
- jamovi y JASP: gratuitos, de código abierto, modernos y — esto es oro para quien empieza — con una interfaz limpísima: cargas un CSV, marcas "t de muestras independientes" y obtienes el contraste con su tamaño de efecto y su gráfico, sin escribir nada. Ambos corren sobre R por debajo, así que crecer hacia R después es natural. JASP añade de serie los enfoques bayesianos.
Para un profesional de negocio sin intención de programar, jamovi o JASP son probablemente la mejor segunda herramienta tras la hoja de cálculo: todos los métodos de este curso, salida ordenada y coste cero.
La IA generativa como asistente de análisis
Los asistentes de IA (como el que quizá te ha acompañado en este campus) han cambiado el día a día del análisis, y merecen un juicio equilibrado:
Donde ayudan de verdad:
- Escribir y explicar código ("¿qué hace esta línea de pandas?", "dame la fórmula de hoja de cálculo para un IC").
- Explorar enfoques: "tengo datos ordinales de satisfacción en 3 grupos, ¿qué contraste encaja?" — y ahora sabes verificar que la respuesta (Kruskal-Wallis) es correcta.
- Redactar: pasar de una tabla de resultados a un borrador de informe ejecutivo.
- Interpretar salidas de software que no conoces.
Donde exigen cautela:
- Verificar los cálculos: un modelo de lenguaje puede equivocarse en aritmética o citar un valor crítico incorrecto con total aplomo. Los números se comprueban con la herramienta estadística; la IA propone, el software dispone.
- No subir datos personales ni confidenciales a servicios externos: los tickets de clientes o los datos del programa de bienestar no salen de NovaMarket sin pasar por compliance (lo viste con el RGPD). Existen despliegues corporativos precisamente para esto.
- El criterio no se delega: la IA no sabe si tu muestra está sesgada, si falta el grupo de control o si el efecto es relevante para el negocio. Ese es exactamente el criterio que has construido en ocho módulos — y la razón de que la IA multiplique al analista formado y confunda al que no lo está.
Un flujo de trabajo reproducible
Sea cual sea la herramienta, los hábitos que distinguen un análisis profesional de una chapuza afortunada:
- Conserva los datos brutos intactos. Una copia de solo lectura, siempre. Toda limpieza se hace sobre copias; si la limpieza fue errónea, se puede volver a empezar.
- Documenta cada paso. Qué filtraste, qué atípicos apartaste y por qué, qué versión del dato usaste. En código, esto sale gratis (el script es la documentación); en hoja de cálculo, una pestaña de "notas del análisis" hace el papel.
- Que otro pueda repetirlo. El estándar de oro: un compañero, con tus datos y tus pasos, llega a tu número. Si tu resultado depende de doce clics que solo tú recuerdas, no es un resultado: es una anécdota.
- Versiona. Nada de
analisis_final_v3_DEFINITIVO_ahora_si.xlsx: fechas en los nombres como mínimo; herramientas de control de versiones cuando trabajes con código. - Separa dato, cálculo y presentación. El informe cita el análisis; el análisis cita el dato. Cuando Marta pregunte "¿de dónde sale este 0,32?", la cadena debe recorrerse en un minuto.
- Registra las decisiones antes de ver los resultados cuando haya contrastes en juego: qué hipótesis, qué \(\alpha\), qué tamaño muestral — el antídoto contra el p-hacking que conociste en Errores, Potencia y Tamaño Muestral.
Cierre del curso: el viaje, lo que sabes hacer y los siguientes pasos
El viaje
Ocho módulos atrás entrabas en las oficinas de NovaMarket sin saber distinguir una mediana de una media. Mira el camino con perspectiva:
| Módulo | Lo que construiste | El momento NovaMarket |
|---|---|---|
| 1 | Población, muestra, tipos de datos, sesgos | Aprender a desconfiar de la encuesta cómoda |
| 2 | Describir: medias, dispersión, percentiles, gráficos | El ticket de 32,40 € con su enorme \(s = 21{,}50\) |
| 3 | Probabilidad, Bayes, valor esperado | El cupón de 5 € valorado en +0,36 €/envío antes de lanzarlo |
| 4 | Binomial, normal, Poisson, TCL | Ventas diarias \(N(43,983;\ 6,200)\) y por qué las medias son normales |
| 5 | Inferir: IC, contrastes, errores, potencia | Dimensionar el piloto del cupón (7.250 por grupo) |
| 6 | Relacionar: correlación, regresión, ANOVA, chi-cuadrado | Superficie y ventas; formatos comparados; hábitos × edad |
| 7 | Series, multivariante, no paramétricos | Los 7,1 M€ previstos para T4 (MAPE 1,8 %); el misterio de Cuenca resuelto; los tres segmentos del Club Nova |
| 8 | Aplicarlo todo: negocio, sociedad, salud, herramientas | El checkout aprobado, la brecha digital medida, el cribado leído con Bayes |
Lo que sabes hacer ahora
- Describir un conjunto de datos con las medidas y los gráficos adecuados a su tipo, y detectar atípicos y asimetrías antes de que contaminen todo lo demás.
- Cuantificar incertidumbre: elegir el modelo de probabilidad razonable, construir un intervalo de confianza y explicárselo a quien decide.
- Contrastar con las reglas del juego completas: hipótesis y \(\alpha\) por delante, tamaño muestral calculado, y la diferencia entre significativo y relevante siempre presente.
- Relacionar variables — y no confundir correlación con causalidad, agregados con individuos, ni un efecto bruto con uno ajustado por confusores.
- Predecir con series temporales y evaluar honestamente el error de predicción.
- Diseñar y leer experimentos: del test A/B al ensayo clínico son el mismo animal, y sabes reconocer cuándo un estudio observacional está vendiendo más de lo que puede probar.
- Elegir herramienta y montar un flujo que otro pueda auditar y repetir.
En una frase: has pasado de consumir cifras a interrogarlas — y esa es la diferencia entre opinar con datos y decidir con datos.
Siguientes pasos
- Practica con datos propios, ya. Esta semana. Los tickets, encuestas o tiempos de tu organización, o datos abiertos (INE, Eurostat, portales open data): elige una pregunta pequeña y recorre el ciclo completo — pregunta, dato, método, resultado, decisión. La estadística se fija haciendo.
- Adopta una segunda herramienta. Si vives en la hoja de cálculo, instala jamovi o JASP esta semana y repite en ellos un análisis que ya hiciste; si te llama la programación, el script de pandas de esta lección es tu punto de partida.
- Profundiza hacia donde apunte tu trabajo: regresión y modelización si te toca explicar y predecir (el camino natural hacia el aprendizaje automático), muestreo y encuestas si trabajas con personas, series temporales si vives de previsiones.
- Sigue en el campus: los cursos de análisis de datos, hojas de cálculo, Python y matemáticas aplicadas de este campus continúan de forma natural varios de los caminos abiertos aquí.
- Relee tus propios informes antiguos. Es el ejercicio más revelador: verás medias sin dispersión, porcentajes sin \(n\), causalidades sin control. No te apures — señal de cuánto has aprendido.
Errores Comunes y Consejos
- Confundir
DESVEST.MconDESVEST.P(yVAR.SconVAR.P): la variante muestral divide entre \(n-1\) y es casi siempre la que quieres; con \(n\) grande apenas cambia, con \(n\) pequeño sí. - Usar
INTERVALO.CONFIANZA.Tcomo si devolviera el intervalo. Devuelve la semiamplitud: el intervalo es media ± resultado. Leído sin cuidado, se reporta un "intervalo" que es solo el margen. - Fiarse de una celda que nadie puede auditar. La hoja no deja rastro de cambios: para análisis que importan, documenta pasos y conserva el dato bruto — o pasa a código, donde el rastro es automático.
- Cambiar de herramienta esperando que resuelva un problema de método. Python calcula la misma media sesgada que Excel, solo que más rápido. Los problemas de muestreo, confusión o diseño no los arregla ninguna sintaxis.
- Copiar código o fórmulas de la IA sin verificar. Pide siempre la explicación línea a línea (ahora puedes seguirla) y comprueba el resultado con un caso pequeño que sepas resolver a mano.
- Aprender herramientas en vez de estadística. Es el error inverso y también existe: quien colecciona cursos de Python sin entender qué es un valor p automatiza confusiones a gran velocidad. Tú ya tienes la base; las herramientas son ejecución.
Ejercicios
Ejercicio 1
Los importes de 500 tickets están en A2:A501. Escribe las fórmulas de hoja de cálculo (en español) para: (a) media y desviación típica muestral; (b) el percentil 90; (c) el intervalo de confianza al 95 % para la media (los dos extremos).
Ejercicio 2
Ejecutas el script de Python de la lección y obtienes: t = 2.31, valor p = 0.0214 para tienda vs online. Con \(\alpha = 0{,}05\): ¿qué concluyes, qué prueba se ha usado exactamente y qué pedirías mirar antes de llevar la conclusión a Marta?
Ejercicio 3
Elige herramienta y justifica: (a) un contraste t puntual sobre 200 filas para una reunión de mañana; (b) el informe semanal de entregas que hoy ocupa 2 h de copiar y pegar; (c) un compañero sin ninguna experiencia en programación quiere hacer ANOVA y chi-cuadrado con salidas presentables y sin coste.
Soluciones
Ejercicio 1.
(a) =PROMEDIO(A2:A501) y =DESVEST.M(A2:A501). (b) =PERCENTIL.INC(A2:A501;0,9). (c) Semiamplitud: =INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500); extremos: =PROMEDIO(A2:A501)-INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500) y lo mismo con +. Errores frecuentes: pasar 0,95 en lugar de 0,05 (la función pide \(\alpha\), no la confianza) y olvidar que devuelve la semiamplitud, no el intervalo.
Ejercicio 2.
Se ha usado la t de Welch para dos muestras independientes (ttest_ind con equal_var=False), bilateral. Como \(0{,}0214 < 0{,}05\), se rechaza \(H_0\): la diferencia de gasto medio entre canales es estadísticamente detectable. Antes de ir a Marta: (1) el tamaño de la diferencia con su IC — significativo no dice cuántos euros, y con muestras grandes puede ser una diferencia irrelevante; (2) los descriptivos y atípicos de cada canal (los importes de tickets son muy asimétricos: quizá convenga contrastar también con Mann-Whitney como comprobación); (3) que la muestra no tenga sesgos de recogida. La herramienta dio el valor p en un segundo; las tres comprobaciones son tu trabajo.
Ejercicio 3.
(a) Hoja de cálculo: PRUEBA.T resuelve en minutos un análisis puntual de 200 filas; montar otra cosa sería sobreingeniería. (b) Python (o R): la repetición semanal es el síntoma clásico — un script lo hace en segundos, sin errores de copia y con rastro auditable; las 2 h se amortizan en un mes. (c) jamovi o JASP: gratuitos, de menús, con ANOVA y chi-cuadrado de serie y salida presentable; SPSS haría lo mismo pero con licencia, y programar contradice el enunciado. Consejo general: la pregunta no es "¿qué herramienta es mejor?" sino "¿qué combinación de tarea, volumen, repetición y perfil tengo delante?".
Conclusión
Aquí termina el curso. Empezó con una pregunta modesta — ¿qué es un dato y cómo se resume? — y acaba contigo eligiendo entre PRUEBA.T, ttest_ind y jamovi para responder preguntas de negocio con intervalos, contrastes y modelos que entiendes por dentro, porque cada uno lo calculaste antes a mano. Por el camino, NovaMarket ha sido tu laboratorio: sus tickets te enseñaron a describir, su cupón a esperar valores, sus tiendas a inferir, su e-commerce a predecir, su Club Nova a segmentar, y sus casos finales a integrar todo el arsenal en decisiones de verdad — en la empresa, en la sociedad y hasta leyendo un titular de salud.
Quédate con las tres ideas que sostienen todo lo demás: los datos varían (y la variabilidad se mide, no se ignora), toda conclusión lleva incertidumbre (y la incertidumbre se cuantifica, no se esconde) y el método sigue a la pregunta (nunca al revés). Las herramientas cambiarán — cambiarán los programas, cambiará la IA —, pero ese criterio es tuyo y ya no te lo quita nadie. Ahora, a por tus propios datos: Marta ya no te hace falta.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
