Laboratorio de entropía en PLN

Visualiza las distribuciones de probabilidad de tokens, la entropía de Shannon, la perplejidad, la entropía cruzada y la divergencia KL — las métricas matemáticas fundamentales usadas para entrenar y evaluar los grandes modelos de lenguaje (LLM) de IA.

Cargando simulación interactiva...

Minimizar la entropía cruzada es lo mismo que predecir el siguiente token 🖖

La entropía cruzada es la función con la que se entrena un modelo de lenguaje, y el motivo no es una convención, sino una identidad. Equivale a la entropía de los datos más la divergencia KL de los datos respecto del modelo. Por tanto, si los datos permanecen fijos, reducir la entropía cruzada implica necesariamente reducir la divergencia KL. Carga Zipf natural: la entropía es de 4,87 bits y la entropía cruzada, de 6,08; la diferencia de 1,21 coincide exactamente con esa divergencia KL. La perplejidad expresa la misma magnitud en una escala más intuitiva: 24,87 = 29,29. La divergencia KL reaparece en el RLHF como la penalización que mantiene el modelo alineado cerca del modelo del que partió.

Qué mide realmente la entropía: la sorpresa 🖖

La entropía cuantifica cuán impredecible es un texto: la «sorpresa» media que aporta cada token. La perplejidad lo traduce en una cifra intuitiva: una perplejidad de 8 significa que el modelo está, en promedio, tan indeciso como si eligiera de forma uniforme entre 8 palabras. Compara un prompt repetitivo con prosa variada y observa cómo sube la perplejidad: el texto predecible puntúa bajo y el diverso, alto.

Shannon midió el inglés con un juego de adivinanzas 🖖

En 1951, Claude Shannon estimó la entropía del inglés no con un ordenador, sino con personas: los sujetos adivinaban la siguiente letra de un texto oculto, y su tasa de acierto acotó el inglés en torno a 0.6 a 1.3 bits por carácter. Esa cifra sigue siendo la referencia: los LLM modernos se juzgan por lo cerca que su perplejidad por carácter llega de ese límite derivado de humanos, setenta años después.

Problema resuelto al detalle

  1. De dónde provienen los cuatro valores de entropía del panel 5 pasos

    Entropía 4,87 bits, perplejidad 29,29, entropía cruzada 6,08, divergencia KL 1,21. Cuatro números en el panel y solo dos de ellos son independientes. Halla las dos relaciones exactas que los vinculan.

    1. La entropía es la sorpresa media de la distribución real, medida en bits: el número de preguntas de sí/no necesarias por token si se codifica de forma óptima para este texto.

    2. La perplejidad simplemente sitúa eso en una escala más intuitiva: dos elevado a la entropía. Responde a la pregunta «¿cuántas opciones igualmente probables producirían esta misma incertidumbre?», y 29,29 es más fácil de imaginar que 4,87 bits.

    3. La entropía cruzada es el coste de codificar la distribución real mediante un código construido para una diferente. Nunca es menor que la entropía, porque el código óptimo para P es óptimo.

    4. El exceso es la divergencia KL, y se trata de una resta, no de un cálculo independiente: 6,08388 − 4,87254 = 1,21134, hasta el último dígito mostrado.

    5. Calcular la exponencial de ese exceso indica lo que cuesta en términos prácticos. 2^1,21 es 2,32, por lo que usar el modelo incorrecto es como enfrentarse a 2,32 veces más opciones por palabra: 29,29 se convierte en 67,8.

    Respuesta

    La herramienta muestra H = 4,87254, PP = 29,2942, H(P,Q) = 6,08388 y DKL = 1,21134. Las dos identidades —la perplejidad es 2^H y la KL es la entropía cruzada menos la entropía— se cumplen para cualquier par de distribuciones, por lo que son una comprobación que se puede realizar en cualquier informe de modelo que se reciba. También explican por qué los modelos de lenguaje se evalúan mediante la entropía cruzada en lugar de la KL: la KL necesita la distribución real, de la que nadie dispone, mientras que la entropía cruzada solo requiere la probabilidad asignada por el modelo al texto que realmente ocurrió. Minimizar una minimiza la otra, porque la diferencia es una constante que el modelo no puede modificar.

Referencias (3)

Problemas de ejemplo

  • Saludo vulcano (uniforme) - Dieciséis tókenes de seis tipos: entropía de 2,50 bits y perplejidad de 5,66, las más bajas de la herramienta pese al nombre. El texto de comparación es idéntico, así que la divergencia KL es exactamente 0.
  • Retórica de Trump (repetitiva) - Veintiocho tókenes de quince tipos dan una entropía de 3,59 y una perplejidad de 12,08, superiores a las de Palabras uniformes. Aquí, «repetitivo» significa que se repiten frases, no que el vocabulario sea reducido.
  • Monólogo de Star Trek (natural) - Treinta y ocho tókenes de treinta y dos tipos: entropía de 4,87 bits y perplejidad de 29,29, las más altas de la herramienta. Este es el estado del problema resuelto.
  • Ciencia ficción vs política (cambio de dominio) - Entropía de 4,01 y perplejidad de 16,13, con un texto de comparación perteneciente a otro ámbito. Ese desajuste eleva la entropía cruzada por encima de la entropía; la diferencia entre ambas es la divergencia KL.