Laboratorio de Media vs Mediana

Compara la media y la mediana en un conjunto discreto con un valor atípico o explora cómo la proporción de personas bajo la media crece con la asimetría en una distribución log-normal.

Cargando simulación interactiva...

La mayoría gana por debajo de la media, y hay una fórmula para saber cuántos 🖖

La media es un punto de equilibrio: un solo número grande puede arrastrarla fuera del alcance de casi todos. La mediana es un recuento: la mitad está por encima y la mitad por debajo. En una población log-normal con forma σ, la proporción bajo la media es exactamente Φ(σ/2).

Un valor atípico mueve la media sin límite y la mediana en absoluto 🖖

Arrastrar un solo dato aumenta la media en 1/n por unidad sin tope. Una vez que un punto supera el centro de los datos, moverlo más no altera la mediana ni un solo centavo.

La medida correcta la decide la pregunta planteada 🖖

Si quieres saber cuánto se reparte en total, ya sea en un presupuesto, en ingresos fiscales o en consumo de combustible, usa la media. Si quieres saber cuánto recibe realmente una persona representativa, usa la mediana. Ninguna de las dos engaña; responden a preguntas distintas.

Problemas resueltos al detalle

  1. Cuántas personas ganan por debajo de la media, solo a partir de la media y la mediana 6 pasos

    Los ingresos siguen una distribución lognormal con σ = 1,5. Calcula qué proporción de personas gana menos que la media. Después, demuestra que nunca hizo falta conocer σ: basta con disponer de la media y la mediana publicadas.

    1. Lognormal significa que el logaritmo es normal: ln X es N(μ, σ²). Todo lo que sigue es una afirmación sobre ln X traducida de vuelta, y ese es el único truco del problema.

    2. La mediana es sencilla. La mitad de ln X se sitúa por debajo de μ y, como el logaritmo conserva el orden, la mitad de X se sitúa por debajo de e^μ. La mediana es e^μ.

    3. La media no es e^μ, y esa diferencia constituye todo el asunto. Para una distribución lognormal es e^(μ + σ²/2); la media se sitúa por encima de la mediana por un factor de e^(σ²/2), que para σ = 1,5 es e^1,125 = 3,0802.

    4. Ahora, la proporción. Preguntar qué fracción gana por debajo de la media equivale a calcular P(X < e^(μ + σ²/2)), y tomar logaritmos en ambos lados lo convierte en P(ln X < μ + σ²/2), que es una pregunta normal con una respuesta normal.

    5. Tipifícala: resta μ y divide entre σ, con lo que μ se cancela. La respuesta es Φ(σ/2), que para σ = 1,5 resulta ser Φ(0,75) = 0,7734. Un 77,34% gana por debajo de la media.

    6. μ desaparece, así que la escala es irrelevante: una población con una mediana de 1, 148 o 22.026 da el mismo 77,3 % que muestra el panel. Sigue ahora el razonamiento en sentido inverso: σ = √(2 ln(media/mediana)). La razón determina σ y, a partir de σ, se obtiene la proporción.

    Respuesta

    El 77,34 % cuando σ = 1,5; y puedes obtener ese dato a partir de una media y una mediana sin conocer σ ni los ingresos de una sola persona. Si un país publica que los ingresos medios equivalen a 1,5 veces la mediana, está indicando que σ = √(2 ln 1,5) = 0,9005 y, por tanto, que el 67,37 % de quienes perciben ingresos está por debajo de la media. No hacen falta microdatos ni acceso a encuestas: bastan dos cifras tomadas de una página oficial. La fórmula también zanja para siempre la discusión de bar: Φ(σ/2) es mayor que 0,5 para todo σ > 0, así que, en CUALQUIER población lognormal, más de la mitad gana menos que la media; cuanto mayor es la desigualdad, más se acerca esa proporción a la población entera. En ninguna distribución de esta familia es cierto que «la mayoría está por encima de la media». La media responde a una pregunta sobre el total que la mediana no responde: multiplícala por la población y obtendrás la masa salarial. Por eso se utiliza para medir una economía y, a la vez, apenas describe a quienes viven en ella.

  2. Cinco hogares, uno de los cinco erróneo, y qué se puede seguir afirmando 6 pasos

    Un pueblo de cinco hogares declara ingresos de 10, 20, 30, 40 y 5.000. Calcula la media y la mediana; supón después que una de las cinco cifras es un error tipográfico y decide qué se puede seguir afirmando.

    1. La media es el total repartido: 5.100 entre cinco hogares da 1.020. Observa qué efecto tiene eso antes de seguir adelante. La media es mayor que cuatro de los cinco números con los que se calculó.

    2. La mediana es una posición, no un total. Ordena los cinco valores y toma el tercero: es 30. Con los mismos datos, cuatro hogares quedan por debajo de la media y dos por debajo de la mediana.

    3. La tarjeta Mean / Median ratio marca 34,00. En datos simétricos vale 1, así que una lectura de 34 es el modo que tiene la página de decir que los dos resúmenes han dejado de describir el mismo pueblo.

    4. Arrastra el quinto valor y observa la media. Se desplaza una quinta parte por cada unidad añadida, sin nada que la detenga: de un extremo al otro del deslizador, la media va de 22 a 1.020.

    5. La mediana, a lo largo del mismo recorrido, solo toma dos valores, 20 y 30, y la razón es la ordenación. Cualquier valor por debajo de 20 deja el 20 en tercera posición; cualquier valor por encima de 30 deja el 30 ahí; y entre ambos el quinto valor es la propia mediana. Tanto si el hogar gana 5.000 como cinco millones, la mediana queda atrapada en una ventana de diez de ancho.

    6. Ahora la versión más difícil de la pregunta. Sabes que una de las cinco cifras es errónea, pero no cuál. Examina los cinco casos: la mediana corregida tiene que caer entre 20 y 40, sea cual sea el valor verdadero. La media corregida podría ser cualquier cosa.

    Respuesta

    Media 1.020, mediana 30. Con una cifra errónea sin identificar, se sabe que la mediana está en [20, 40]; de la media no se sabe nada.

    Esa ventana es lo que la robustez significa una vez que se cuantifica, y va más allá de una sola cifra errónea. Dos de estos cinco números pueden ser arbitrarios y la mediana seguirá cayendo entre el menor y el mayor de los tres que sean correctos; tres no, porque dos supervivientes dejan libre la posición central. La fracción que un resumen puede soportar es su punto de ruptura: uno entre n para la media, que se reduce a nada a medida que la muestra crece, y un medio para la mediana. El coste es el mismo hecho leído al revés. Este pueblo tiene una mediana de 30 tanto si el quinto hogar gana 5.000 como 50, de modo que la mediana no puede revelar que alguien aquí sea rico. Ninguno de los dos números dirá ambas cosas, y por eso se citan juntos.

Ruta de aprendizaje

Un número para muchos: estadísticas de resumen

Lleva a spread-and-deviation

Referencias (2)

Problemas de ejemplo

  • Un atípico (5.000) - Cuatro valores en 10, 20, 30, 40 y un atípico en 5.000. La media se dispara a 1.020,00 mientras la mediana se mantiene firme en 30,00.
  • Conjunto simétrico (50) - Cinco valores repartidos uniformemente (10, 20, 30, 40, 50). La media (30,00) y la mediana (30,00) coinciden exactamente.
  • Asimetría leve (σ = 0,5) - En una población moderadamente asimétrica (σ = 0,50), la media es 1,13 veces la mediana, y el 59,9% se sitúa por debajo de la media.
  • Asimetría fuerte (σ = 1,5) - En una población muy asimétrica (σ = 1,50), la media es 3,08 veces la mediana, y el 77,3% se sitúa por debajo de la media.