A las oficinas centrales de NovaMarket ha llegado un encargo distinto: la asociación sectorial de la distribución quiere elaborar un gran estudio sobre hábitos de consumo en España, y ha pedido al equipo de Marta que participe en su diseño y análisis. De repente, el objeto de estudio ya no son 42 tiendas ni 380.000 socios con datos transaccionales perfectos: son 48 millones de personas a las que hay que preguntar. Ese salto — de medir comportamientos registrados a encuestar a una sociedad — es el terreno de la estadística en ciencias sociales, y tiene sus propias reglas y sus propias trampas: muestras que hay que ponderar, opiniones medidas en escalas ordinales, correlaciones entre territorios que no valen para personas, y causas que casi nunca se pueden establecer con un experimento. Esta lección recorre todo eso con casos trabajados.

Contenido

  1. Qué cambia cuando el dato es una persona encuestada
  2. Encuestas a gran escala: estratos y conglomerados
  3. Ponderación y post-estratificación: arreglar la muestra que te ha salido
  4. El margen de error de un barómetro
  5. Comparar grupos sociales: chi-cuadrado y la brecha digital
  6. Escalas ordinales: cómo tratar (bien) un Likert
  7. Correlación ecológica y falacia ecológica
  8. Causalidad sin laboratorio: observación, confusión y experimentos naturales
  9. Ética de las encuestas: anonimato, consentimiento y RGPD

Qué cambia cuando el dato es una persona encuestada

En NovaMarket, cada ticket es un hecho registrado por una caja. En una encuesta, el dato es lo que alguien declara, y entre la realidad y la respuesta se interponen todos los sesgos de Recolección de Datos y Muestreo, amplificados:

  • Sesgo de no respuesta: quien contesta no es como quien no contesta (¿recuerdas la campaña de 2.000 invitaciones con 640 respuestas? Extrapolar ese 32 % al resto era arriesgado; en encuestas sociales la no respuesta supera a menudo el 70 %).
  • Deseabilidad social: la gente declara reciclar más, beber menos y leer más de lo que hace.
  • Sesgo de cobertura: encuestar solo por internet deja fuera justo a quienes menos lo usan — fatal si el estudio trata, precisamente, de hábitos digitales.
  • Efecto del cuestionario: el orden y la redacción de las preguntas mueven los resultados.

La consecuencia: en ciencias sociales el diseño muestral y el trabajo de campo pesan tanto como el análisis. Un análisis brillante sobre una muestra torcida solo produce conclusiones torcidas con decimales.

Encuestas a gran escala: estratos y conglomerados

El estudio sectorial prevé 2.500 entrevistas presenciales. Un muestreo aleatorio simple de todo el censo sería carísimo (2.500 entrevistadores dispersos por 8.000 municipios), así que se combinan las dos técnicas que ya conoces:

  • Estratificación: la población se divide en grupos homogéneos (comunidad autónoma × tamaño de municipio) y se reparte la muestra proporcionalmente entre ellos. Garantiza que cada estrato esté representado y reduce la varianza del estimador.
  • Conglomerados (etapas): dentro de cada estrato se sortean municipios, dentro de cada municipio secciones censales, y dentro de cada sección hogares. Abarata el campo (los entrevistadores se concentran), pero aumenta la varianza: los vecinos de una misma sección se parecen entre sí, así que 10 entrevistas en la misma calle aportan menos información que 10 dispersas.

Ese sobrecoste se mide con el efecto de diseño (deff): si deff = 1,5, las 2.500 entrevistas informan como \(2,500 / 1{,}5 \approx 1,667\) entrevistas aleatorias simples ("tamaño muestral efectivo"). Los barómetros serios lo publican en su ficha técnica; ignorarlo hace que el margen de error declarado sea optimista.

Ponderación y post-estratificación: arreglar la muestra que te ha salido

Aunque el diseño sea bueno, la muestra final nunca clava la estructura de la población: los jóvenes están menos en casa y contestan menos. La solución estándar es ponderar: dar a cada respuesta un peso que restaure las proporciones poblacionales conocidas (del censo o del INE). Ejemplo pequeño y completo, con la pregunta "¿compra online al menos una vez al mes?":

Grupo de edad % población Muestra obtenida (\(n=1,000\)) % muestra Peso = % pob. / % muestra % compra online
18–34 25 % 150 15 % 1,667 62 %
35–54 40 % 420 42 % 0,952 38 %
55+ 35 % 430 43 % 0,814 12 %
  • Estimación sin ponderar: \((150 \cdot 0{,}62 + 420 \cdot 0{,}38 + 430 \cdot 0{,}12)/1,000 = (93 + 159{,}6 + 51{,}6)/1,000 = 30{,}4\ %\).
  • Estimación ponderada: cada grupo pesa lo que pesa en la población: \(0{,}25 \times 62 + 0{,}40 \times 38 + 0{,}35 \times 12 = 15{,}5 + 15{,}2 + 4{,}2 = 34{,}9\ %\).

Casi 5 puntos de diferencia, solo por la infrarrepresentación de los jóvenes (los que más compran online). Esto es la post-estratificación: se hace después del campo, usando variables cuya distribución poblacional se conoce (edad, sexo, territorio, nivel educativo). Dos límites honestos: solo corrige la no respuesta ligada a las variables de ponderación (si dentro de los jóvenes contestan los más digitales, el sesgo persiste), y los pesos extremos inflan la varianza — un grupo casi vacío en la muestra no se arregla multiplicándolo por 8.

El margen de error de un barómetro

Las fichas técnicas tipo CIS dicen cosas como: "2.500 entrevistas; margen de error ±2,0 % para el conjunto de la muestra, con un nivel de confianza del 95,5 % y en el supuesto p = q = 0,5". Ahora puedes leer cada pieza con lo aprendido en Intervalos de Confianza:

\[ e = z \sqrt{\frac{p(1-p)}{n}} = 2 \times \sqrt{\frac{0{,}5 \times 0{,}5}{2,500}} = 2 \times 0{,}01 = 0{,}02 = \pm 2 \text{ puntos} \]

  • \(p = q = 0{,}5\) es el caso peor: maximiza \(p(1-p)\), así que el margen real de cualquier porcentaje concreto es igual o menor.
  • El 95,5 % corresponde a \(z = 2\) exacto (los institutos lo prefieren al 1,96 del 95 %).
  • El margen vale para el total; para un subgrupo (los 150 jóvenes de la muestra) el margen es \(2\sqrt{0{,}25/150} \approx \pm 8\) puntos. Los titulares que comparan subgrupos pequeños suelen olvidarlo.
  • Y todo ello supone muestreo aleatorio simple: con conglomerados, el deff lo ensancha.

Lectura profesional: cuando un hábito "sube del 31 % al 32 %" entre dos oleadas de \(n = 2,500\), el cambio está dentro del margen — es indistinguible del ruido, exactamente la lógica de Pruebas de Hipótesis.

Comparar grupos sociales: chi-cuadrado y la brecha digital

Primera pregunta sustantiva del estudio: ¿la compra online habitual depende de la edad? Dos variables categóricas → tabla de contingencia y chi-cuadrado. Submuestra de 1.200 personas (400 por grupo):

18–34 35–54 55+ Total
Compra online habitual 248 168 76 492
No 152 232 324 708
Total 400 400 400 1.200

Bajo \(H_0\) (independencia), cada grupo tendría \(400 \times 492/1,200 = 164\) compradores habituales. El estadístico:

\[ \chi^2 = \frac{(248-164)^2}{164} + \frac{(168-164)^2}{164} + \frac{(76-164)^2}{164} + \frac{(152-236)^2}{236} + \frac{(232-236)^2}{236} + \frac{(324-236)^2}{236} \]

\[ \chi^2 = 43{,}0 + 0{,}1 + 47{,}2 + 29{,}9 + 0{,}1 + 32{,}8 \approx 153{,}1 \]

Con \((2-1)(3-1) = 2\) grados de libertad, el valor crítico al 5 % es 5,99: la asociación es abrumadora (\(p < 0{,}001\)). El tamaño del efecto, con la V de Cramér: \(V = \sqrt{153{,}1/(1,200 \times 1)} = 0{,}36\), una asociación moderada-fuerte. Pero el número que irá al informe es el descriptivo: 62 % de compradores habituales entre los jóvenes frente a 19 % entre los mayores de 55. Esa distancia es la brecha digital, y condiciona decisiones muy concretas: para NovaMarket, que el canal online no sustituye a la tienda física en el cliente sénior; para el sector, dónde no debe cerrarse la atención presencial.

Escalas ordinales: cómo tratar (bien) un Likert

Media España responde encuestas con escalas Likert: "valore de 1 (nada de acuerdo) a 5 (totalmente de acuerdo)". Son datos ordinales (Tipos de Datos): el orden significa, las distancias no — nada garantiza que de 4 a 5 haya "lo mismo" que de 2 a 3. Consecuencias prácticas:

  • Descripción: mediana y distribución de frecuencias antes que la media. "Mediana 4; el 71 % responde 4 o 5" informa más — y más honestamente — que "media 3,84". La media de un Likert se usa (y se abusa) por comodidad; si se reporta, siempre acompañada de la distribución.
  • Comparación de grupos: los métodos de rangos de la lección de Métodos No Paramétricos: Mann-Whitney para dos grupos, Kruskal-Wallis para varios. Ejemplo del estudio: la confianza en la compra online (1–5) da mediana 4 en zonas urbanas y 3 en rurales; Mann-Whitney arroja \(p = 0{,}002\) → el desplazamiento es real, y se comunica con las medianas y los porcentajes de cada nivel, no con "0,6 puntos de media".
  • Suma de ítems: cuando se suman muchos ítems Likert en un índice (p. ej., 10 preguntas de confianza digital, rango 10–50), el total se comporta de forma casi continua y los métodos paramétricos vuelven a ser razonables. Es la excepción que confirma la regla.

Correlación ecológica y falacia ecológica

El equipo cruza datos por provincia: renta media provincial y porcentaje provincial de compra online. La correlación sale \(r = 0{,}81\): fortísima. Titular tentador: "cuanto más rico eres, más compras online". Alto ahí.

Esa \(r = 0{,}81\) es una correlación ecológica: entre agregados (provincias), no entre personas. Dentro de cada provincia, la correlación individual entre renta y compra online puede ser mucho más débil (en el estudio, \(r \approx 0{,}25\)) o incluso de signo contrario. Concluir sobre individuos a partir de agregados es la falacia ecológica, documentada desde el clásico de Robinson (1950): en los años 30, los estados de EE. UU. con más inmigrantes tenían mayor alfabetización (correlación agregada positiva), mientras que a nivel individual los inmigrantes estaban menos alfabetizados — simplemente se instalaban en estados más alfabetizados. Los agregados mezclan la composición del grupo con el comportamiento de sus miembros.

Regla profesional: la unidad del análisis debe coincidir con la unidad de la conclusión. Datos provinciales → conclusiones sobre provincias ("las provincias de mayor renta concentran más compra online", útil para logística); para hablar de personas hacen falta datos de personas.

Causalidad sin laboratorio: observación, confusión y experimentos naturales

En la web de NovaMarket se puede aleatorizar un checkout (Estadística en Negocios); en la sociedad no se puede aleatorizar el nivel educativo ni la renta. Casi todo estudio social es observacional, y ahí la correlación es una pista, no un veredicto — el "correlación no implica causalidad" de Análisis de Correlación en su hábitat natural.

Un ejemplo trabajado de confusión

El estudio encuentra: compra online habitual del 54 % entre quienes tienen estudios superiores frente al 31 % del resto. ¿La educación causa compra online? Estratifiquemos por edad, la sospechosa habitual:

Con estudios superiores Sin estudios superiores
18–34 66 % 62 %
55+ 20 % 17 %

Dentro de cada grupo de edad, la diferencia por educación es de 3–4 puntos, no de 23. ¿Qué pasaba? Que los titulados superiores son, en promedio, mucho más jóvenes (la expansión universitaria es reciente), y la edad — la brecha digital del apartado del chi-cuadrado — hacía casi todo el trabajo. La edad es una variable de confusión: relacionada a la vez con la "causa" aparente y con el efecto. Es el mismo fenómeno de reversión parcial que viste como paradoja de Simpson en Chi-Cuadrado, y la razón de ser de la regresión múltiple de Análisis Multivariante: "controlar por" edad es, precisamente, comparar dentro de cada estrato. Recordatorio de Cuenca: su "déficit" de ventas también desapareció al controlar por tráfico peatonal.

Herramientas del oficio social

  • Ajuste por confusores: estratificar o meter los confusores en una regresión (múltiple o logística). Límite: solo controla lo que se ha medido.
  • Experimentos naturales: a veces la realidad aleatoriza sola — un cambio normativo que entra en vigor en una comunidad autónoma y no en la vecina, un sorteo de plazas, un corte por fecha de nacimiento. Comparar justo a ambos lados de esa frontera se acerca al experimento. (El despliegue escalonado del servicio de entrega en 2 h de NovaMarket por ciudades funcionó como uno: permitió comparar ciudades con y sin servicio antes y después.)
  • Jerarquía de confianza: experimento aleatorizado > experimento natural bien defendido > observacional ajustado > correlación bruta. En ciencias sociales se vive casi siempre en los dos escalones intermedios, y la honestidad consiste en decirlo.

Ética de las encuestas: anonimato, consentimiento y RGPD

Encuestar es tratar datos personales, y en Europa eso activa el RGPD. Lo mínimo que el equipo debe garantizar en el estudio sectorial:

  • Consentimiento informado: el encuestado sabe quién trata sus datos, para qué, y acepta libremente; puede negarse a cualquier pregunta y retirarse.
  • Minimización: solo se pregunta lo necesario para los fines del estudio (la afiliación política no pinta nada en un estudio de consumo).
  • Anonimización real: separar identificadores de respuestas, y cuidado con la reidentificación por cruce — "mujer de 34 años, farmacéutica, de un municipio de 800 habitantes" es identificable aunque no lleve nombre. Los microdatos públicos se publican con celdas pequeñas agregadas.
  • Categorías especiales (salud, ideología, religión, orientación sexual): protección reforzada; en general, evitarlas salvo necesidad justificada y consentimiento explícito.
  • Conservación y seguridad: plazos definidos, acceso restringido, y derecho de supresión operativo.

Advertencia: esta sección es una orientación estadística, no asesoramiento jurídico. Antes de lanzar cualquier encuesta con datos personales, el diseño (cuestionario, avisos de privacidad, plan de conservación) debe revisarlo el delegado de protección de datos o un profesional de compliance. En NovaMarket ninguna encuesta sale sin ese visto bueno, y en tu organización debería pasar lo mismo.

La ética no es un peaje: una encuesta que la gente percibe como respetuosa obtiene más respuesta y mejor respuesta — es también un problema de calidad del dato.

Errores Comunes y Consejos

  • Analizar la muestra cruda cuando hay no respuesta diferencial. Sin ponderar, los grupos que menos contestan desaparecen del resultado (30,4 % vs 34,9 % en el ejemplo). Pondera con variables poblacionales conocidas — y desconfía de pesos extremos.
  • Aplicar el margen de error global a los subgrupos. El ±2 % de \(n = 2,500\) se convierte en ±8 % para 150 jóvenes. Cada porcentaje viaja con el \(n\) que lo sostiene.
  • Promediar Likerts sin mirar la distribución. Una media de 3,0 puede ser "todo el mundo indiferente" o "mitad entusiasta, mitad en contra": decisiones opuestas. Mediana + distribución, siempre.
  • Saltar de agregados a individuos. La correlación provincial no habla de personas (falacia ecológica). Unidad de análisis = unidad de conclusión.
  • Leer causalidad en datos observacionales sin buscar confusores. Antes de firmar "la educación causa X", estratifica por edad, renta y territorio. Si el efecto sobrevive, sigue siendo una hipótesis — más fuerte, pero hipótesis.
  • Tratar la ética como papeleo final. Consentimiento, anonimato y minimización se diseñan al principio; parchearlos después suele ser imposible (y sancionable).

Ejercicios

Ejercicio 1

En una encuesta municipal (\(n = 500\)), el 40 % de la muestra tiene menos de 40 años cuando en el padrón son el 30 %. Apoyo a ampliar la peatonalización del centro: 60 % entre menores de 40, 40 % entre el resto. Calcula la estimación sin ponderar y la post-estratificada.

Ejercicio 2

Del estudio sectorial: uso de la app de la cadena por hábitat. Urbano: 260 usuarios de 500; rural: 96 de 300. Contrasta la independencia con chi-cuadrado (\(\alpha = 0{,}05\), valor crítico 3,84) e interpreta en términos de brecha digital.

Ejercicio 3

Un informe concluye: "las provincias con más supermercados por habitante tienen menor tasa de obesidad (\(r = -0{,}6\)); por tanto, abrir supermercados reduce la obesidad de las personas". Señala los dos problemas distintos de esta frase.

Soluciones

Ejercicio 1.

Sin ponderar: \(0{,}40 \times 60 + 0{,}60 \times 40 = 24 + 24 = 48{,}0\ %\). Ponderada: \(0{,}30 \times 60 + 0{,}70 \times 40 = 18 + 28 = 46{,}0\ %\). La sobrerrepresentación juvenil inflaba el apoyo en 2 puntos — suficiente para cruzar el 50 % psicológico en titulares apretados. Error frecuente: ponderar con los tamaños muestrales en lugar de con los poblacionales; los pesos correctos restauran la población, no la muestra.

Ejercicio 2.

Totales: 356 usuarios, 444 no; \(n = 800\). Esperados: urbano-sí \(500 \times 356/800 = 222{,}5\); urbano-no 277,5; rural-sí 133,5; rural-no 166,5. \(\chi^2 = \frac{(260-222{,}5)^2}{222{,}5} + \frac{(240-277{,}5)^2}{277{,}5} + \frac{(96-133{,}5)^2}{133{,}5} + \frac{(204-166{,}5)^2}{166{,}5} = 6{,}3 + 5{,}1 + 10{,}5 + 8{,}4 = 30{,}3 > 3{,}84\): se rechaza la independencia (\(p < 0{,}001\)). Descriptivo para el informe: 52 % de uso urbano frente a 32 % rural — 20 puntos de brecha digital territorial, relevante para decidir dónde la app puede sustituir canales y dónde no. Consejo: como siempre, el valor p dice "hay asociación"; los porcentajes dicen cuánta y para quién.

Ejercicio 3.

(1) Falacia ecológica: la correlación es entre provincias; nada dice de si las personas que viven cerca de un supermercado son menos obesas. (2) Causalidad desde datos observacionales: aun a nivel provincial, renta y hábitat urbano son confusores obvios (las provincias ricas y urbanas tienen más supermercados y menos obesidad por muchas otras vías). La frase comete los dos pecados a la vez; una versión defendible sería: "a nivel provincial, densidad comercial y obesidad están negativamente asociadas; la relación individual y su sentido causal requieren datos individuales y ajuste por confusores". Consejo: entrenar el reflejo de preguntarse "¿cuál es la unidad?" y "¿qué tercera variable explicaría esto?" vale más que cualquier fórmula de esta lección.

Conclusión

El encargo sectorial te ha llevado del dato transaccional perfecto al dato declarado e imperfecto, y has visto el arsenal adaptarse: estratos y conglomerados con su efecto de diseño, la post-estratificación que devolvió 5 puntos a los jóvenes ausentes, el margen de error de barómetro leído con ojos de la lección de intervalos, el chi-cuadrado que cuantificó la brecha digital, los Likert tratados como lo que son (ordinales), la falacia ecológica de Robinson y la edad desenmascarada como confusora del efecto "educación". Y una constante: en lo social, la causalidad se argumenta con diseño y humildad, no se calcula.

El siguiente encargo abre otra puerta: la aseguradora que gestiona el programa de bienestar de los 8.000 empleados de NovaMarket propone analizar juntos sus resultados, y los informes vienen llenos de riesgos relativos, odds ratios, sensibilidades y curvas de supervivencia. Toca aprender a leer — con espíritu crítico y sin jugar a médicos — el idioma de la Estadística en Ciencias de la Salud.

© Copyright 2026. Todos los derechos reservados