No todos los datos son iguales, y tratarlos como si lo fueran es la fuente de algunos de los errores más embarazosos del análisis de datos: calcular la «media» de un código postal, ordenar provincias alfabéticamente y llamarlo «ranking», o sumar valoraciones de satisfacción como si fueran euros. En esta lección aprenderás a clasificar las variables (cualitativas y cuantitativas, con sus subtipos), a reconocer las cuatro escalas de medida y las operaciones que cada una admite, a distinguir datos transversales de longitudinales, y a evaluar la calidad de un conjunto de datos antes de analizarlo. Trabajaremos sobre dos materiales muy concretos de NovaMarket: un ticket de compra y una ficha de cliente del Club Nova.

Contenido

  1. El material de trabajo: un ticket y una ficha de cliente
  2. Variables cualitativas y cuantitativas
  3. Las cuatro escalas de medida
  4. Qué operaciones admite cada escala
  5. Datos transversales y datos longitudinales
  6. Calidad de los datos: perdidos, errores y duplicados

El material de trabajo: un ticket y una ficha de cliente

Marta te ha pedido que documentes los datos que maneja el equipo, empezando por las dos tablas más usadas. Recuerda de la lección anterior: cada fila es una observación y cada columna una variable. Hoy nos centramos en las columnas.

Tabla de tickets (unidad de análisis: el ticket):

ID ticket Fecha Tienda Canal Nº artículos Importe (€) Método de pago ¿Usó cupón?
T-881204 2026-08-20 Valencia-Ruzafa Física 14 47,85 Tarjeta Sí
T-881205 2026-08-20 Online Online 32 96,10 Tarjeta No
T-881206 2026-08-20 Bilbao-Casco Física 3 8,95 Efectivo No

Ficha de cliente del Club Nova (unidad de análisis: el socio):

Nº socio Código postal Fecha de alta Edad Tramo de gasto Satisfacción (0-10) Nº hijos Tienda habitual
S-1041 46006 2021-03-12 38 Alto 8 2 Valencia-Ruzafa
S-2233 08025 2023-11-02 55 Medio 6 0 Barcelona-Gràcia
S-0512 28010 2019-06-30 42 Bajo 9 1 Madrid-Chamberí

A simple vista, casi todo son «números o textos». Pero para la estadística, lo relevante no es el formato, sino qué representa cada variable y qué tiene sentido hacer con ella. Vamos a clasificarlas.

Variables cualitativas y cuantitativas

La primera gran división:

  • Variables cualitativas (o categóricas): expresan una cualidad o categoría, no una cantidad. Responden a «¿de qué tipo?». Ejemplos: método de pago, tienda, canal.
  • Variables cuantitativas (o numéricas): expresan una cantidad medible. Responden a «¿cuánto?» o «¿cuántos?». Ejemplos: importe, número de artículos, edad.

Cuidado: que algo se escriba con cifras no lo convierte en cuantitativo. El código postal 46006 es un número, pero no mide ninguna cantidad: es una etiqueta de zona. La prueba definitiva es preguntarse: ¿tendría sentido calcular una media de esta variable? La «media de códigos postales» de tus socios (por ejemplo, 27.347) no significa absolutamente nada.

Subtipos de cualitativas

  • Nominales: categorías sin orden natural. Método de pago (tarjeta, efectivo, móvil), tienda habitual, canal (física/online). Ninguna categoría es «más» que otra.
  • Ordinales: categorías con orden natural, pero sin que las distancias entre ellas sean medibles. El tramo de gasto (Bajo < Medio < Alto) tiene orden claro, pero ¿la distancia entre Bajo y Medio es igual que entre Medio y Alto? No lo sabemos; solo sabemos ordenar.

Caso especial: las variables dicotómicas o binarias (dos categorías), como «¿Usó cupón?» (Sí/No). Son nominales, y aparecerán constantemente en el curso (en el Módulo 4 verás que tienen su propia distribución de probabilidad, la binomial).

Subtipos de cuantitativas

  • Discretas: toman valores contables, normalmente enteros, con «saltos» entre valores posibles. Nº de artículos del ticket (3, 4, 5… nunca 3,7), nº de hijos.
  • Continuas: pueden tomar, en teoría, cualquier valor dentro de un intervalo; entre dos valores siempre cabe otro. El importe del ticket (47,85 €), el tiempo de entrega (21,53 horas), el peso de la fruta vendida.

Matiz práctico: el importe en euros se registra con dos decimales, pero se trata como continua porque mide una magnitud (dinero) que fluye de forma prácticamente continua. La frontera discreta/continua es a veces una decisión de modelado más que una propiedad absoluta.

Clasificación completa de nuestras variables

Variable Tabla Tipo Subtipo
Tienda / Tienda habitual Ambas Cualitativa Nominal
Canal Tickets Cualitativa Nominal (binaria)
Método de pago Tickets Cualitativa Nominal
¿Usó cupón? Tickets Cualitativa Nominal (binaria)
Código postal Clientes Cualitativa Nominal (¡aunque sea numérica!)
Tramo de gasto Clientes Cualitativa Ordinal
Satisfacción (0-10) Clientes Cualitativa ordinal (a menudo tratada como cuantitativa; ver más abajo) Ordinal
Nº artículos Tickets Cuantitativa Discreta
Nº hijos Clientes Cuantitativa Discreta
Importe (€) Tickets Cuantitativa Continua
Edad Clientes Cuantitativa Continua (registrada en años cumplidos)
Fecha / Fecha de alta Ambas Cuantitativa de intervalo (ver escalas) —

Las cuatro escalas de medida

La clasificación cualitativa/cuantitativa se refina con las escalas de medida propuestas por Stevens, que determinan con precisión qué operaciones matemáticas son legítimas.

  1. Escala nominal: solo permite decir si dos valores son iguales o distintos. No hay orden. Ejemplo: método de pago.
  2. Escala ordinal: además de igualdad, permite ordenar (mayor/menor), pero las diferencias entre valores no son interpretables. Ejemplo: tramo de gasto Bajo/Medio/Alto.
  3. Escala de intervalo: además de ordenar, las diferencias entre valores sí son interpretables y constantes, pero no existe un cero absoluto (el cero es convencional), así que los cocientes no tienen sentido. Ejemplos: la temperatura en °C de las cámaras frigoríficas de NovaMarket (0 °C no es «ausencia de temperatura»; 20 °C no es «el doble de calor» que 10 °C) o las fechas (el año 0 es una convención; el 2000 no es «el doble» que el 1000).
  4. Escala de razón: como la de intervalo, pero con cero absoluto que significa «ausencia de la magnitud». Aquí sí tienen sentido los cocientes: un ticket de 60 € sí es el doble que uno de 30 €. Ejemplos: importe, nº de artículos, tiempo de entrega, edad.

El caso de la satisfacción 0-10

Estrictamente, una valoración de satisfacción es ordinal: no hay garantía de que la distancia entre un 6 y un 7 sea igual que entre un 9 y un 10 en la mente del cliente. Sin embargo, en la práctica empresarial es habitual tratarla como si fuera de intervalo (calcular medias de satisfacción), y con muchas respuestas suele funcionar razonablemente. Lo importante es que sepas que es una convención práctica, que conviene acompañarla de la distribución de respuestas (cuántos 0-6, cuántos 7-8, cuántos 9-10) y que existen métodos específicamente diseñados para datos ordinales (los métodos no paramétricos, que se tratan en el Módulo 7).

Qué operaciones admite cada escala

Esta tabla es de las más útiles del curso; vuelve a ella cada vez que dudes:

Operación Nominal Ordinal Intervalo Razón
Contar frecuencias y calcular porcentajes Sí Sí Sí Sí
Moda (valor más frecuente) Sí Sí Sí Sí
Ordenar, mediana, percentiles No Sí Sí Sí
Sumar/restar, media, desviación típica No No* Sí Sí
Cocientes («el doble de», ratios) No No No Sí

* Salvo la convención práctica comentada para escalas tipo Likert/satisfacción.

(La media, la mediana, la moda y la desviación típica se estudian a fondo en el Módulo 2; aquí solo necesitas saber a qué variables puede aplicarse cada una.)

Ejemplo trabajado: ¿qué puedo hacer con cada variable?

Marta te pasa estos 6 tickets de la tienda de Bilbao-Casco de esta mañana y te pide «un resumen de cada columna»:

ID Método de pago Nº artículos Importe (€)
T-1 Tarjeta 5 12,50
T-2 Efectivo 2 4,30
T-3 Tarjeta 8 25,00
T-4 Móvil 5 15,20
T-5 Tarjeta 1 2,10
T-6 Efectivo 9 31,90

Método de pago (nominal). Solo podemos contar: Tarjeta 3 de 6 (50 %), Efectivo 2 de 6 (33,3 %), Móvil 1 de 6 (16,7 %). La moda es «Tarjeta». Calcular una «media de métodos de pago» no tiene sentido.

Nº de artículos (razón, discreta). Todo está permitido. Por ejemplo, la media:

\[ \bar{x} = \frac{5 + 2 + 8 + 5 + 1 + 9}{6} = \frac{30}{6} = 5 \text{ artículos} \]

Y como es escala de razón, los cocientes son válidos: el ticket T-6 (9 artículos) tiene el triple de artículos que el T-2 (3 veces 3… cuidado, comprobemos: \( 9/2 = 4,5 \), o sea 4,5 veces los artículos del T-2 — verifica siempre los cocientes antes de escribirlos en un informe).

Importe (razón, continua). Media:

\[ \bar{x} = \frac{12,50 + 4,30 + 25,00 + 15,20 + 2,10 + 31,90}{6} = \frac{91,00}{6} \approx 15,17 \text{ €} \]

También son válidas afirmaciones de razón: «el ticket mayor (31,90 €) es unas 15 veces el menor (2,10 €)», porque \( 31,90 / 2,10 \approx 15,2 \).

Datos transversales y datos longitudinales

Otra distinción clave es cuándo se recogen los datos:

  • Datos transversales (cross-section): se observa a muchas unidades en un mismo momento (o periodo). Foto fija. Ejemplo: la satisfacción de 1.200 socios encuestados en septiembre de 2026, o las ventas de las 42 tiendas ayer.
  • Datos longitudinales / series temporales: se observa a la misma unidad (o unidades) a lo largo del tiempo. Película. Ejemplo: las ventas mensuales de la tienda de Zaragoza desde 2020, o el gasto trimestral del socio S-1041 desde su alta.
Aspecto Transversales Longitudinales
Metáfora Fotografía Película
Qué varía Las unidades (muchas filas = muchas unidades) El tiempo (muchas filas = muchos momentos)
Pregunta típica en NovaMarket «¿Qué tiendas venden más este mes?» «¿Cómo evolucionan las ventas de cada tienda?»
Riesgo típico No capta tendencias ni estacionalidad Requiere técnicas propias (los datos vecinos en el tiempo se parecen entre sí)

¿Por qué importa? Porque los métodos de la mayor parte de este curso presuponen datos transversales (u observaciones independientes). Los datos con estructura temporal —donde diciembre siempre se dispara por Navidad y cada mes «hereda» algo del anterior— necesitan técnicas específicas que se desarrollan en la lección de Series Temporales del Módulo 7. Por ahora basta con que sepas reconocer ante qué tipo de datos estás, porque aplicar una media simple a una serie con fuerte estacionalidad puede llevar a conclusiones engañosas.

Existe también el formato mixto (datos de panel): muchas unidades seguidas a lo largo del tiempo, como el gasto mensual de todos los socios del club durante tres años. Es la estructura más rica, y también la más compleja de analizar.

Calidad de los datos: perdidos, errores y duplicados

Antes de analizar nada, un profesional inspecciona sus datos. Se estima que los analistas dedican más tiempo a limpiar datos que a analizarlos, y con razón: un análisis impecable sobre datos sucios produce conclusiones sucias (garbage in, garbage out). Los tres problemas clásicos:

Valores perdidos (missing)

Celdas vacías o marcadas como desconocidas. En la ficha de clientes de NovaMarket, la edad falta en muchos socios (no es obligatoria al darse de alta). Preguntas que debes hacerte:

  • ¿Cuántos faltan? Un 2 % de edades perdidas apenas molesta; un 60 % invalida cualquier análisis por edad.
  • ¿Faltan al azar o con patrón? Esto es lo crucial. Si la edad falta sobre todo en los socios que se dieron de alta por la web (donde el campo era opcional), los socios con edad conocida no representan al conjunto: cualquier «edad media de nuestros socios» estará sesgada hacia el perfil que se apunta en tienda.
  • ¿Qué hago con ellos? Las opciones van desde excluir esas filas (aceptable si son pocas y faltan al azar) hasta técnicas de imputación más avanzadas. Lo inaceptable es no mirar.

Errores de registro

Valores presentes pero incorrectos. Ejemplos reales del día a día de NovaMarket:

  • Una edad de 142 años (error de tecleo: probablemente 42).
  • Un ticket de −35,80 € (¿devolución legítima o error? Hay que averiguarlo antes de decidir si se excluye).
  • Una fecha de alta 2062-03-12 (año imposible: transposición de 2026).
  • La misma tienda escrita de tres formas: «Valencia-Ruzafa», «valencia ruzafa», «VLC-Ruzafa» — para el ordenador son tres tiendas distintas, y tus recuentos por tienda quedarán fragmentados.

Defensa práctica: definir reglas de validación (edad entre 18 y 105, importes entre −500 y 3.000 €, fechas no futuras, catálogo cerrado de nombres de tienda) y revisar sistemáticamente los valores fuera de rango. Ojo: un valor extremo no siempre es un error — un ticket de 1.900 € puede ser una compra real de una empresa de catering. La técnica para detectar y valorar valores atípicos se estudia en el Módulo 2 (Medidas de Posición y Valores Atípicos); la decisión de si es error o dato legítimo suele exigir investigar el caso.

Duplicados

La misma observación registrada dos veces. Si un fallo del TPV envía dos veces el ticket T-881204, la venta del día aparecerá inflada. Los duplicados son especialmente traicioneros porque cada uno parece un dato válido; solo se detectan comparando filas entre sí (mismo ID, o misma combinación fecha-tienda-importe-hora). Verifica siempre que el identificador (ID ticket, nº de socio) sea realmente único antes de contar o sumar.

Mini-checklist de calidad

Antes de cualquier análisis en NovaMarket (y en tu empresa real), recorre esta lista:

  1. ¿Es único el identificador de cada fila? (duplicados)
  2. ¿Cuántos valores faltan por columna y siguen algún patrón? (perdidos)
  3. ¿Hay valores fuera de rango lógico o categorías mal escritas? (errores)
  4. ¿Coincide el total con alguna fuente independiente? (por ejemplo, la suma de tickets con la caja declarada)
  5. ¿Está documentado qué significa cada columna y cómo se recoge? (diccionario de datos)

Errores Comunes y Consejos

  • Tratar como cuantitativa una variable numérica que es una etiqueta. Códigos postales, números de socio, códigos de producto: si la media no significa nada, es cualitativa. Pregúntate siempre «¿esto mide una cantidad?».
  • Promediar ordinales sin pensarlo. La media de satisfacción es una convención útil, pero jamás promedies códigos ordinales arbitrarios (por ejemplo, Bajo=1, Medio=2, Alto=3, media=2,4) y lo presentes como una medida precisa: los números 1-2-3 los has elegido tú.
  • Afirmar razones en escalas de intervalo. «Hoy hace el doble de calor que ayer» (20 °C vs 10 °C) es incorrecto; con fechas y temperaturas solo son válidas las diferencias.
  • Analizar una serie temporal como si fuera una foto fija. Comparar la media de ventas de noviembre-diciembre con la de enero-febrero «para ver si la tienda mejora» ignora la estacionalidad navideña.
  • Saltarse la inspección de calidad. El coste de descubrir duplicados después de presentar el informe a dirección es mucho mayor que los veinte minutos de checklist previa.
  • Consejo profesional: crea (o pide) el diccionario de datos de cada tabla que uses: nombre de la variable, significado, tipo, escala, valores válidos y cómo se recoge. Es la herramienta más barata y rentable de la calidad de datos.

Ejercicios

Ejercicio 1

Clasifica cada variable de esta tabla de la encuesta de entregas del e-commerce de NovaMarket indicando: (a) cualitativa o cuantitativa, (b) subtipo (nominal/ordinal o discreta/continua) y (c) escala de medida (nominal, ordinal, intervalo o razón).

  1. Provincia de entrega
  2. Tiempo de entrega en horas (por ejemplo, 26,4)
  3. Valoración de la entrega: «Mala / Regular / Buena / Excelente»
  4. Nº de bultos del pedido
  5. Temperatura (°C) registrada en el interior del camión refrigerado
  6. ¿Hubo incidencia? (Sí/No)

Ejercicio 2

Indica si cada afirmación es estadísticamente legítima según la escala de la variable, y corrige las que no lo sean:

  1. «El pedido P-201 (60 €) costó el doble que el P-187 (30 €).»
  2. «La cámara de congelados está hoy a −18 °C y ayer estaba a −9 °C: hace el doble de frío.»
  3. «El código postal medio de nuestros socios valencianos es 46.021.»
  4. «La valoración mediana de las entregas fue “Buena”.»

Ejercicio 3

Marta te pasa este extracto de la tabla de socios para un análisis urgente. Identifica todos los problemas de calidad que encuentres y clasifícalos (perdido, error de registro o duplicado):

Nº socio Código postal Fecha de alta Edad Tienda habitual
S-4410 28010 2024-05-11 39 Madrid-Chamberí
S-4411 08025 2031-02-20 47 Barcelona-Gràcia
S-4412 46006 2022-09-03 Valencia-Ruzafa
S-4413 41013 2023-01-15 230 Sevilla-Nervión
S-4410 28010 2024-05-11 39 Madrid-Chamberí
S-4414 50006 2020-07-22 51 zaragoza centro

Soluciones

Solución 1

  1. Provincia: cualitativa nominal, escala nominal.
  2. Tiempo de entrega: cuantitativa continua, escala de razón (0 horas significa ausencia de espera; 40 h sí es el doble que 20 h).
  3. Valoración Mala/Regular/Buena/Excelente: cualitativa ordinal, escala ordinal (hay orden, pero las distancias no son medibles).
  4. Nº de bultos: cuantitativa discreta, escala de razón.
  5. Temperatura en °C: cuantitativa continua, escala de intervalo (el 0 °C es convencional; las razones no valen).
  6. ¿Hubo incidencia?: cualitativa nominal binaria, escala nominal.

Error frecuente: clasificar la temperatura como escala de razón. En °C el cero no es absoluto (sí lo sería en kelvin).

Solución 2

  1. Legítima: el importe es escala de razón, los cocientes valen.
  2. No legítima: la temperatura en °C es de intervalo; solo cabe decir «está 9 °C más fría». (El «doble de frío» ni siquiera está bien definido.)
  3. No legítima: el código postal es nominal; la media no significa nada. Corrección posible: «el código postal más frecuente (moda) entre nuestros socios valencianos es el 46021».
  4. Legítima: la mediana solo necesita orden, y una variable ordinal lo tiene. (La media, en cambio, no sería apropiada sin convenciones adicionales.)

Solución 3

  • S-4411, fecha de alta 2031-02-20: error de registro (fecha futura; hoy es 2026).
  • S-4412, edad vacía: valor perdido.
  • S-4413, edad 230: error de registro (valor imposible; quizá 23 o 30).
  • Quinta fila (S-4410 repetido): duplicado exacto de la primera fila.
  • S-4414, «zaragoza centro»: error de registro de categoría (formato inconsistente con el catálogo «Zaragoza-Centro»; fragmentaría los recuentos por tienda).

Error frecuente: marcar la edad 230 como «valor atípico a estudiar». Los atípicos legítimos son valores extremos pero posibles (un ticket de 1.900 €); una edad de 230 años es imposible y por tanto es un error, no un atípico.

Conclusión

Ya sabes leer una tabla de datos con ojos de estadístico: distingues variables cualitativas (nominales y ordinales) de cuantitativas (discretas y continuas), conoces las cuatro escalas de medida y, sobre todo, sabes qué operaciones admite cada una — el criterio que te salvará de promediar códigos postales o de duplicar «el frío» de una cámara. También distingues la foto fija de los datos transversales de la película de los longitudinales, y dispones de una checklist para cazar valores perdidos, errores de registro y duplicados antes de que contaminen un informe. Con el material ya clasificado y limpio, queda la pregunta anterior a todas: ¿de dónde salen los datos y cómo conseguir que representen bien a la población? De eso trata la próxima lección, Recolección de Datos y Muestreo, donde ayudarás a Marta a diseñar la encuesta anual de satisfacción de NovaMarket.

© Copyright 2026. Todos los derechos reservados