El chiste del estadístico es viejo, pero sigue funcionando. Bill Gates entra en un bar. La renta media de los clientes se dispara y, técnicamente, todos somos millonarios. Es fácil de entender, fácil de contar y fácil de olvidar. Lo oímos, sonreímos, y seguimos creyendo que la media es un buen resumen de lo normal. Al fin y al cabo, aparece en los telediarios, en los informes de empresa y en los titulares de prensa económica. Es un número que suena a autoridad. Es rápido de leer y difícil de cuestionar. Es, además, fácil de calcular: sumas, divides, y ya tienes una respuesta.
Pero hay una versión que no puedes olvidar tan rápido porque te pasa cada vez que lees una estadística de empleo o un informe económico.
Imagina tu empresa. Nueve compañeros cobran 25.000 € al año. El CEO cobra 2.000.000. La media salarial es 222.500 €. La mediana, 25.000 €. Ambas son “verdades” matemáticas. Una de ellas describe tu vida. La otra, la de quien redacta el informe anual para que la empresa parezca generosa y el mercado laboral, boyante.
La media no miente. Pero elige con cuidado a quién le cuenta la verdad.
Un número que no es tuyo
El problema no es que la media sea mala. Es que la media cuenta una historia sobre el conjunto entero que no coincide con la experiencia de la mayoría. Cuando sumas a todos y divides, das el mismo peso al CEO que al becario. Eso es justo matemáticamente. Es injusto narrativamente. No porque la fórmula esté rota, sino porque la pregunta importa tanto como la respuesta.
Cuando un organismo oficial publica el “salario medio” del sector, no está cometiendo un error técnico. Está eligiendo una verdad que le conviene. Si tú usas ese número para negociar una oferta, estás negociando contra una fantasía. Si un ayuntamiento usa la “población media por barrio” para decidir dónde construir un colegio, la media le puede hacer creer que hay recursos suficientes donde en realidad hay un bloque de lujo vacío la mayor parte del año. Y si un inversor usa el “precio medio de venta” para decidir si entra en un mercado, puede confundir el deseo de unos pocos con la demanda de la mayoría.
La elección de medida deja de ser técnica y se vuelve una decisión con consecuencias reales. No es un error de cálculo. Es una decisión sobre dinero, recursos o política pública con base en datos que elige quien publica.
Es por eso que en el libro no tratamos la media como un dato a memorizar. La tratamos como una elección que define qué parte de la realidad decides mostrar.
De vuelta a los datos
En el libro trabajamos con Ames Housing, un dataset de 1.458 viviendas reales de Iowa. Es un dataset que se va enriqueciendo a lo largo de las unidades: primero lo limpias, luego lo analizas, luego lo modelas. En la UT06 — Análisis Exploratorio de Datos, usas medidas de tendencia central y dispersión para entender la historia que cuentan los datos antes de entrenar nada.
La media de SalePrice ronda los 180.800 $. La mediana, los 163.000 $. La diferencia ronda los 18.000 $, un 10 % por encima. Ese 10 % no es ruido. Es un puñado de mansiones caras tirando del promedio hacia arriba como si el resto de casas no existiera.
Si entrenas un modelo de predicción usando la media como referencia de “precio normal”, tenderás a sobrestimar la mayoría de las viviendas. El modelo no falla porque el algoritmo sea malo. Falla porque alguien leyó mal la historia antes de empezar. Falla porque la media le hizo creer que el mercado era más rico de lo que es. La mayoría de los compradores no buscan una mansión. Buscan una casa normal. Y el modelo, cegado por la media, les dirá que tienen que pagar más de lo que el mercado real justifica.
Es un error que se ve en competiciones de ciencia de datos, en informes de consultoras y en dashboards de startups. Si aprendes a detectarlo en un notebook de práctica, lo evitarás en tu primer trabajo. No es teoría. Es oficio.
Con pandas, la diferencia se detecta en segundos:
mean_val = df['SalePrice'].mean() # ~180.800
median_val = df['SalePrice'].median() # ~163.000
diff = mean_val - median_val
pct = diff / median_val * 100
# La media supera a la mediana en un ~11 %
La herramienta no juzga. Tú sí. Y el modelo, por desgracia, tampoco.
¿Cuándo usar cada una?
El libro resume una regla que no es de memoria, sino de contexto:
| Medida | Cuándo usarla | Ejemplos reales |
|---|---|---|
| Media | Distribuciones simétricas sin outliers | Alturas, temperaturas |
| Mediana | Distribuciones asimétricas o con outliers | Salarios, precios de viviendas |
La media funciona cuando los datos respiran con cierta regularidad. Cuando no hay un rico, una mansión o un valor atípico que distorsione el paisaje. Es útil para fenómenos naturales donde los extremos se compensan y la distribución se parece a una campana. Alturas, temperaturas, pesos: en todos ellos, la media describe bien el centro porque los valores altos y bajos se equilibran.
La mediana funciona cuando el suelo está minado por desigualdades. Cuando unos pocos concentran mucho y el resto se amontona en el centro. Salarios, precios de viviendas, patrimonios. No es una preferencia estética. Es una respuesta a la forma del mundo.
Elegir mal no es solo un fallo técnico. Es una forma de no ver lo que está delante.
Es tentador usar la media por costumbre. Es la que enseñaron primero, la que suena más natural, la que cualquier hoja de cálculo calcula por defecto. Pero la costumbre no es una razón. Es una excusa.
La estadística no miente. Pero quien elige qué medida contar puede usarla para que parezca que sí.
Y si quieres practicar esto con datos reales —detectar la asimetría, decidir la medida, entender las consecuencias antes de entrenar un modelo— la UT06 — Análisis Exploratorio de Datos del libro Análisis de Datos con Python te lleva por el proceso paso a paso, desde el primer histograma hasta la decisión de qué medida usar en un informe que otro leerá.
¿Te has fiado alguna vez de una media que no describía tu realidad?