Todo el curso has trabajado "a mano": fórmulas, tablas y calculadora. Ha sido deliberado — quien entiende el cálculo entiende el resultado —, pero en el día a día nadie suma 33.000 tickets con lápiz. Esta última lección es el puente al trabajo real: un panorama honesto de las herramientas con las que se hace estadística en una empresa, de la hoja de cálculo (que llega mucho más lejos de lo que se suele creer) a Python y R (que empiezan donde aquella se agota), pasando por el software estadístico clásico y el uso sensato de la IA generativa. Verás el análisis de NovaMarket reproducido con fórmulas de hoja de cálculo, un primer contacto comentado con pandas y scipy, y criterios para elegir herramienta según la tarea. Y, como es la última lección, cierra también el curso: qué camino has recorrido y hacia dónde seguir.

Contenido

  1. El mapa: qué herramienta para qué tarea
  2. La hoja de cálculo como primera herramienta seria
  3. NovaMarket en fórmulas: el curso entero en una hoja
  4. Tablas dinámicas: frecuencias y cruces sin fórmulas
  5. Dónde se acaba la hoja de cálculo
  6. Python con pandas y scipy: el siguiente escalón
  7. R: el otro gran camino
  8. Software estadístico clásico: SPSS, Stata, jamovi y JASP
  9. La IA generativa como asistente de análisis
  10. Un flujo de trabajo reproducible
  11. Cierre del curso: el viaje, lo que sabes hacer y los siguientes pasos

El mapa: qué herramienta para qué tarea

No hay una herramienta "mejor": hay emparejamientos mejores o peores entre tarea, volumen de datos y perfil de quien analiza.

Herramienta Ideal para Se queda corta cuando Curva de aprendizaje
Hoja de cálculo Descriptivos, IC, pruebas t y chi-cuadrado, gráficos rápidos, datos < ~100.000 filas Análisis repetibles, datos grandes, métodos avanzados Baja (ya la usas)
jamovi / JASP Todos los contrastes del curso con menús y salida limpia, gratis Automatización, datos muy grandes Baja
SPSS / Stata Lo mismo, estándar en academia y consultoría Presupuesto (licencias), flexibilidad Media
R Cualquier método estadístico existente; gráficos de calidad Quien no quiera programar nada Media-alta
Python (pandas/scipy) Estadística + automatización + integración con sistemas y ML Métodos estadísticos muy de nicho (R llega antes) Media-alta

La trayectoria natural del profesional de negocio es de arriba abajo: dominar de verdad la hoja de cálculo, probar jamovi/JASP cuando los menús ayuden, y dar el salto a Python o R cuando la repetición o el volumen lo pidan.

La hoja de cálculo como primera herramienta seria

Excel, Google Sheets y LibreOffice Calc comparten (con nombres casi idénticos en español) un arsenal estadístico que cubre la mayor parte de este curso. La tabla siguiente es tu mapa de vuelta: cada función, con la lección donde aprendiste qué significa.

Función (ES) Qué calcula Lección
PROMEDIO, MEDIANA, MODA.UNO Tendencia central 02-01
DESVEST.M, VAR.S Desviación típica y varianza muestrales (divisor \(n-1\)) 02-02
PERCENTIL.INC, CUARTIL.INC Percentiles y cuartiles 02-03
CONTAR.SI, FRECUENCIA Frecuencias 02-04
DISTR.BINOM.N, POISSON.DIST Probabilidades binomial y Poisson 04-01, 04-03
DISTR.NORM.N, DISTR.NORM.INV Probabilidades y percentiles de la normal 04-02
INTERVALO.CONFIANZA.T Semiamplitud del IC de la media (t) 05-02
PRUEBA.T, PRUEBA.Z Valor p de pruebas t y z 05-03
COEF.DE.CORREL Correlación de Pearson 06-01
PENDIENTE, INTERSECCION.EJE, COEFICIENTE.R2, ESTIMACION.LINEAL Regresión lineal 06-02
PRUEBA.CHICUAD Valor p de chi-cuadrado (observados vs esperados) 06-04
PRONOSTICO.LINEAL, PRONOSTICO.ETS Previsión (lineal / alisado con estacionalidad) 07-01

Además, el complemento gratuito Análisis de datos de Excel (Herramientas para análisis) añade ANOVA, regresión múltiple con su salida completa e histogramas — con él, la hoja cubre hasta buena parte del módulo 6 y 7.

NovaMarket en fórmulas: el curso entero en una hoja

Supón la hoja tickets con 500 tickets de Madrid-Centro: importes en A2:A501 y, en B2:B501, el canal (tienda/online). Así se reproduce, fórmula a fórmula, el trabajo del curso:

  • Descriptiva (módulo 2):
    • Media: =PROMEDIO(A2:A501) → 32,40 €
    • Desviación: =DESVEST.M(A2:A501) → 21,50 € (fíjate: la .M de muestral; DESVEST.P dividiría entre \(n\) y sería la poblacional)
    • Mediana y P90: =MEDIANA(A2:A501), =PERCENTIL.INC(A2:A501;0,9)
    • CV: =DESVEST.M(A2:A501)/PROMEDIO(A2:A501) → 0,66: la enorme dispersión relativa de los tickets, vieja conocida.
  • Probabilidad (módulo 4): ¿probabilidad de que una tienda venda menos de 40.000 € en un día, con \(N(43,983;\ 6,200)\)? =DISTR.NORM.N(40000;43983;6200;VERDADERO) → 0,26. El percentil 95 de la demanda del caso de inventario: =DISTR.NORM.INV(0,95;720;70) → 835,1.
  • Inferencia (módulo 5): IC al 95 % para el ticket medio:
    • Semiamplitud: =INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500) → 1,89
    • Intervalo: media ± semiamplitud → \((30{,}51;\ 34{,}29)\) €.
  • Contraste (módulo 5): ¿gastan igual tienda y online? Con los importes de cada canal en D2:D341 y E2:E161: =PRUEBA.T(D2:D341;E2:E161;2;3) → devuelve directamente el valor p (el 2 pide contraste bilateral; el 3, varianzas distintas — la variante de Welch, la opción prudente por defecto).
  • Regresión (módulo 6): ventas vs superficie de las 42 tiendas en G2:H43: =PENDIENTE(H2:H43;G2:G43), =INTERSECCION.EJE(H2:H43;G2:G43), =COEFICIENTE.R2(H2:H43;G2:G43) — y la regresión múltiple del R² = 0,912, con el complemento de análisis o =ESTIMACION.LINEAL con varias columnas de X.

La lección de fondo: todo lo que calculaste a mano en el curso vive a una fórmula de distancia. La hoja no piensa por ti — sigue haciendo falta saber que PRUEBA.T contrasta medias y qué significa su valor p —, pero ejecuta por ti.

Tablas dinámicas: frecuencias y cruces sin fórmulas

Para variables categóricas, la herramienta reina de la hoja es la tabla dinámica: arrastras canal a filas y obtienes la distribución de frecuencias de 02-04; arrastras grupo de edad a columnas y tienes la tabla de contingencia de 06-04 — la del cruce hábitos × edad de la lección de ciencias sociales se monta en 30 segundos. Con "mostrar valores como % de fila" lees los perfiles directamente. Para el contraste, calculas al lado los esperados (total fila × total columna / total) y rematas con PRUEBA.CHICUAD(observados;esperados). Media de importe por segmento y formato, mínimos y máximos por transportista... cualquier "¿cuánto vale X por grupo?" es una tabla dinámica antes que cien fórmulas.

Dónde se acaba la hoja de cálculo

Honestidad obligada; la hoja se agota, y conviene reconocer los síntomas:

  • Repetición: el mismo análisis cada semana, con el mismo ritual de copiar-pegar-ajustar-rangos. Cada repetición manual es una oportunidad de error silencioso.
  • Volumen: cientos de miles de filas la vuelven lenta e inestable (y los 4,5 millones de tickets mensuales de NovaMarket, sencillamente, no caben).
  • Trazabilidad: una celda sobrescrita no deja rastro; auditar quién cambió qué es casi imposible. Errores célebres de hojas de cálculo han costado carreras y presupuestos públicos.
  • Métodos: logística, ACP, k-means, Kaplan-Meier, no paramétricos serios... o no existen o exigen contorsiones.
  • Mezcla de dato y cálculo: en una hoja, los datos brutos y las fórmulas conviven y se contaminan; los flujos serios los separan.

Ninguno de estos límites invalida la hoja para lo que hace bien: análisis puntuales, tamaños moderados, comunicación. Solo marcan la frontera.

Python con pandas y scipy: el siguiente escalón

Python es hoy el idioma más común del análisis de datos en empresa. Dos bibliotecas bastan para reproducir el curso: pandas (tablas de datos) y scipy.stats (métodos estadísticos). Un primer script completo, línea a línea:

import pandas as pd                        # pandas: tablas de datos ("DataFrames")
from scipy import stats                    # scipy.stats: funciones estadísticas

df = pd.read_csv("tickets.csv")            # carga el CSV: una fila por ticket
print(df["importe"].describe())            # n, media, desviación, mín, cuartiles, máx
                                           # (todo el módulo 2 en una línea)

media = df["importe"].mean()               # media muestral
s = df["importe"].std()                    # desviación típica muestral (divisor n-1)
n = len(df)                                # tamaño muestral

ic = stats.t.interval(0.95, df=n - 1,      # IC al 95 % con la t de Student:
        loc=media, scale=s / n ** 0.5)     # centro = media, escala = error estándar
print(f"IC 95%: {ic}")                     # p. ej. (30.51, 34.29) — como en la hoja

tienda = df[df["canal"] == "tienda"]["importe"]    # filtra los tickets de tienda
online = df[df["canal"] == "online"]["importe"]    # y los de online
t, p = stats.ttest_ind(tienda, online, equal_var=False)  # t de Welch (dos muestras)
print(f"t = {t:.2f}, valor p = {p:.4f}")   # el mismo contraste de la lección 05-03

Lo importante no es memorizar la sintaxis, sino ver el patrón: cada línea ejecuta algo que ya sabes interpretar. describe() es el módulo 2; t.interval, la lección 05-02; ttest_ind, la 05-03. En scipy viven también chi2_contingency (chi-cuadrado), f_oneway (ANOVA), pearsonr y mannwhitneyu; la regresión múltiple y la logística, en la biblioteca statsmodels; el k-means que segmentó al Club Nova, en scikit-learn. Aprender Python para datos es un curso en sí mismo — aquí basta con que sepas que la puerta existe, que está abierta y que el idioma que se habla al otro lado es el que acabas de aprender.

R: el otro gran camino

R nació para la estadística y sigue siendo el estándar en investigación: cualquier método publicado tiene paquete en R antes que en ningún sitio. El equivalente del script anterior:

tickets <- read.csv("tickets.csv")   # cargar los datos
summary(tickets$importe)             # descriptivos básicos
t.test(importe ~ canal,              # t de Welch e IC del 95 % en una sola
       data = tickets)               # llamada: fórmula "importe según canal"

Elegir entre Python y R importa menos de lo que parece: los conceptos son idénticos y migrar cuesta días, no meses. Orientación práctica: entorno de ingeniería de datos/ML y automatización → Python; entorno académico, bioestadística o gráficos estadísticos finos → R.

Software estadístico clásico: SPSS, Stata, jamovi y JASP

Entre la hoja y la programación hay una tercera vía: programas de menús pensados para estadística.

  • SPSS (IBM) y Stata: veteranos de ciencias sociales, salud y consultoría; salidas completas y documentadas, pero licencias caras.
  • jamovi y JASP: gratuitos, de código abierto, modernos y — esto es oro para quien empieza — con una interfaz limpísima: cargas un CSV, marcas "t de muestras independientes" y obtienes el contraste con su tamaño de efecto y su gráfico, sin escribir nada. Ambos corren sobre R por debajo, así que crecer hacia R después es natural. JASP añade de serie los enfoques bayesianos.

Para un profesional de negocio sin intención de programar, jamovi o JASP son probablemente la mejor segunda herramienta tras la hoja de cálculo: todos los métodos de este curso, salida ordenada y coste cero.

La IA generativa como asistente de análisis

Los asistentes de IA (como el que quizá te ha acompañado en este campus) han cambiado el día a día del análisis, y merecen un juicio equilibrado:

Donde ayudan de verdad:

  • Escribir y explicar código ("¿qué hace esta línea de pandas?", "dame la fórmula de hoja de cálculo para un IC").
  • Explorar enfoques: "tengo datos ordinales de satisfacción en 3 grupos, ¿qué contraste encaja?" — y ahora sabes verificar que la respuesta (Kruskal-Wallis) es correcta.
  • Redactar: pasar de una tabla de resultados a un borrador de informe ejecutivo.
  • Interpretar salidas de software que no conoces.

Donde exigen cautela:

  • Verificar los cálculos: un modelo de lenguaje puede equivocarse en aritmética o citar un valor crítico incorrecto con total aplomo. Los números se comprueban con la herramienta estadística; la IA propone, el software dispone.
  • No subir datos personales ni confidenciales a servicios externos: los tickets de clientes o los datos del programa de bienestar no salen de NovaMarket sin pasar por compliance (lo viste con el RGPD). Existen despliegues corporativos precisamente para esto.
  • El criterio no se delega: la IA no sabe si tu muestra está sesgada, si falta el grupo de control o si el efecto es relevante para el negocio. Ese es exactamente el criterio que has construido en ocho módulos — y la razón de que la IA multiplique al analista formado y confunda al que no lo está.

Un flujo de trabajo reproducible

Sea cual sea la herramienta, los hábitos que distinguen un análisis profesional de una chapuza afortunada:

  1. Conserva los datos brutos intactos. Una copia de solo lectura, siempre. Toda limpieza se hace sobre copias; si la limpieza fue errónea, se puede volver a empezar.
  2. Documenta cada paso. Qué filtraste, qué atípicos apartaste y por qué, qué versión del dato usaste. En código, esto sale gratis (el script es la documentación); en hoja de cálculo, una pestaña de "notas del análisis" hace el papel.
  3. Que otro pueda repetirlo. El estándar de oro: un compañero, con tus datos y tus pasos, llega a tu número. Si tu resultado depende de doce clics que solo tú recuerdas, no es un resultado: es una anécdota.
  4. Versiona. Nada de analisis_final_v3_DEFINITIVO_ahora_si.xlsx: fechas en los nombres como mínimo; herramientas de control de versiones cuando trabajes con código.
  5. Separa dato, cálculo y presentación. El informe cita el análisis; el análisis cita el dato. Cuando Marta pregunte "¿de dónde sale este 0,32?", la cadena debe recorrerse en un minuto.
  6. Registra las decisiones antes de ver los resultados cuando haya contrastes en juego: qué hipótesis, qué \(\alpha\), qué tamaño muestral — el antídoto contra el p-hacking que conociste en Errores, Potencia y Tamaño Muestral.

Cierre del curso: el viaje, lo que sabes hacer y los siguientes pasos

El viaje

Ocho módulos atrás entrabas en las oficinas de NovaMarket sin saber distinguir una mediana de una media. Mira el camino con perspectiva:

Módulo Lo que construiste El momento NovaMarket
1 Población, muestra, tipos de datos, sesgos Aprender a desconfiar de la encuesta cómoda
2 Describir: medias, dispersión, percentiles, gráficos El ticket de 32,40 € con su enorme \(s = 21{,}50\)
3 Probabilidad, Bayes, valor esperado El cupón de 5 € valorado en +0,36 €/envío antes de lanzarlo
4 Binomial, normal, Poisson, TCL Ventas diarias \(N(43,983;\ 6,200)\) y por qué las medias son normales
5 Inferir: IC, contrastes, errores, potencia Dimensionar el piloto del cupón (7.250 por grupo)
6 Relacionar: correlación, regresión, ANOVA, chi-cuadrado Superficie y ventas; formatos comparados; hábitos × edad
7 Series, multivariante, no paramétricos Los 7,1 M€ previstos para T4 (MAPE 1,8 %); el misterio de Cuenca resuelto; los tres segmentos del Club Nova
8 Aplicarlo todo: negocio, sociedad, salud, herramientas El checkout aprobado, la brecha digital medida, el cribado leído con Bayes

Lo que sabes hacer ahora

  • Describir un conjunto de datos con las medidas y los gráficos adecuados a su tipo, y detectar atípicos y asimetrías antes de que contaminen todo lo demás.
  • Cuantificar incertidumbre: elegir el modelo de probabilidad razonable, construir un intervalo de confianza y explicárselo a quien decide.
  • Contrastar con las reglas del juego completas: hipótesis y \(\alpha\) por delante, tamaño muestral calculado, y la diferencia entre significativo y relevante siempre presente.
  • Relacionar variables — y no confundir correlación con causalidad, agregados con individuos, ni un efecto bruto con uno ajustado por confusores.
  • Predecir con series temporales y evaluar honestamente el error de predicción.
  • Diseñar y leer experimentos: del test A/B al ensayo clínico son el mismo animal, y sabes reconocer cuándo un estudio observacional está vendiendo más de lo que puede probar.
  • Elegir herramienta y montar un flujo que otro pueda auditar y repetir.

En una frase: has pasado de consumir cifras a interrogarlas — y esa es la diferencia entre opinar con datos y decidir con datos.

Siguientes pasos

  1. Practica con datos propios, ya. Esta semana. Los tickets, encuestas o tiempos de tu organización, o datos abiertos (INE, Eurostat, portales open data): elige una pregunta pequeña y recorre el ciclo completo — pregunta, dato, método, resultado, decisión. La estadística se fija haciendo.
  2. Adopta una segunda herramienta. Si vives en la hoja de cálculo, instala jamovi o JASP esta semana y repite en ellos un análisis que ya hiciste; si te llama la programación, el script de pandas de esta lección es tu punto de partida.
  3. Profundiza hacia donde apunte tu trabajo: regresión y modelización si te toca explicar y predecir (el camino natural hacia el aprendizaje automático), muestreo y encuestas si trabajas con personas, series temporales si vives de previsiones.
  4. Sigue en el campus: los cursos de análisis de datos, hojas de cálculo, Python y matemáticas aplicadas de este campus continúan de forma natural varios de los caminos abiertos aquí.
  5. Relee tus propios informes antiguos. Es el ejercicio más revelador: verás medias sin dispersión, porcentajes sin \(n\), causalidades sin control. No te apures — señal de cuánto has aprendido.

Errores Comunes y Consejos

  • Confundir DESVEST.M con DESVEST.P (y VAR.S con VAR.P): la variante muestral divide entre \(n-1\) y es casi siempre la que quieres; con \(n\) grande apenas cambia, con \(n\) pequeño sí.
  • Usar INTERVALO.CONFIANZA.T como si devolviera el intervalo. Devuelve la semiamplitud: el intervalo es media ± resultado. Leído sin cuidado, se reporta un "intervalo" que es solo el margen.
  • Fiarse de una celda que nadie puede auditar. La hoja no deja rastro de cambios: para análisis que importan, documenta pasos y conserva el dato bruto — o pasa a código, donde el rastro es automático.
  • Cambiar de herramienta esperando que resuelva un problema de método. Python calcula la misma media sesgada que Excel, solo que más rápido. Los problemas de muestreo, confusión o diseño no los arregla ninguna sintaxis.
  • Copiar código o fórmulas de la IA sin verificar. Pide siempre la explicación línea a línea (ahora puedes seguirla) y comprueba el resultado con un caso pequeño que sepas resolver a mano.
  • Aprender herramientas en vez de estadística. Es el error inverso y también existe: quien colecciona cursos de Python sin entender qué es un valor p automatiza confusiones a gran velocidad. Tú ya tienes la base; las herramientas son ejecución.

Ejercicios

Ejercicio 1

Los importes de 500 tickets están en A2:A501. Escribe las fórmulas de hoja de cálculo (en español) para: (a) media y desviación típica muestral; (b) el percentil 90; (c) el intervalo de confianza al 95 % para la media (los dos extremos).

Ejercicio 2

Ejecutas el script de Python de la lección y obtienes: t = 2.31, valor p = 0.0214 para tienda vs online. Con \(\alpha = 0{,}05\): ¿qué concluyes, qué prueba se ha usado exactamente y qué pedirías mirar antes de llevar la conclusión a Marta?

Ejercicio 3

Elige herramienta y justifica: (a) un contraste t puntual sobre 200 filas para una reunión de mañana; (b) el informe semanal de entregas que hoy ocupa 2 h de copiar y pegar; (c) un compañero sin ninguna experiencia en programación quiere hacer ANOVA y chi-cuadrado con salidas presentables y sin coste.

Soluciones

Ejercicio 1.

(a) =PROMEDIO(A2:A501) y =DESVEST.M(A2:A501). (b) =PERCENTIL.INC(A2:A501;0,9). (c) Semiamplitud: =INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500); extremos: =PROMEDIO(A2:A501)-INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500) y lo mismo con +. Errores frecuentes: pasar 0,95 en lugar de 0,05 (la función pide \(\alpha\), no la confianza) y olvidar que devuelve la semiamplitud, no el intervalo.

Ejercicio 2.

Se ha usado la t de Welch para dos muestras independientes (ttest_ind con equal_var=False), bilateral. Como \(0{,}0214 < 0{,}05\), se rechaza \(H_0\): la diferencia de gasto medio entre canales es estadísticamente detectable. Antes de ir a Marta: (1) el tamaño de la diferencia con su IC — significativo no dice cuántos euros, y con muestras grandes puede ser una diferencia irrelevante; (2) los descriptivos y atípicos de cada canal (los importes de tickets son muy asimétricos: quizá convenga contrastar también con Mann-Whitney como comprobación); (3) que la muestra no tenga sesgos de recogida. La herramienta dio el valor p en un segundo; las tres comprobaciones son tu trabajo.

Ejercicio 3.

(a) Hoja de cálculo: PRUEBA.T resuelve en minutos un análisis puntual de 200 filas; montar otra cosa sería sobreingeniería. (b) Python (o R): la repetición semanal es el síntoma clásico — un script lo hace en segundos, sin errores de copia y con rastro auditable; las 2 h se amortizan en un mes. (c) jamovi o JASP: gratuitos, de menús, con ANOVA y chi-cuadrado de serie y salida presentable; SPSS haría lo mismo pero con licencia, y programar contradice el enunciado. Consejo general: la pregunta no es "¿qué herramienta es mejor?" sino "¿qué combinación de tarea, volumen, repetición y perfil tengo delante?".

Conclusión

Aquí termina el curso. Empezó con una pregunta modesta — ¿qué es un dato y cómo se resume? — y acaba contigo eligiendo entre PRUEBA.T, ttest_ind y jamovi para responder preguntas de negocio con intervalos, contrastes y modelos que entiendes por dentro, porque cada uno lo calculaste antes a mano. Por el camino, NovaMarket ha sido tu laboratorio: sus tickets te enseñaron a describir, su cupón a esperar valores, sus tiendas a inferir, su e-commerce a predecir, su Club Nova a segmentar, y sus casos finales a integrar todo el arsenal en decisiones de verdad — en la empresa, en la sociedad y hasta leyendo un titular de salud.

Quédate con las tres ideas que sostienen todo lo demás: los datos varían (y la variabilidad se mide, no se ignora), toda conclusión lleva incertidumbre (y la incertidumbre se cuantifica, no se esconde) y el método sigue a la pregunta (nunca al revés). Las herramientas cambiarán — cambiarán los programas, cambiará la IA —, pero ese criterio es tuyo y ya no te lo quita nadie. Ahora, a por tus propios datos: Marta ya no te hace falta.

© Copyright 2026. Todos los derechos reservados