Laboratoire d'entropie en TAL

Visualise les distributions de probabilité des tokens, l'entropie de Shannon, la perplexité, l'entropie croisée et la divergence KL — les métriques mathématiques fondamentales utilisées pour entraîner et évaluer les grands modèles de langage (LLM) d'IA.

Chargement de la simulation interactive...

Minimiser l’entropie croisée, c’est exactement prédire le prochain token 🖖

L’entropie croisée est la fonction de coût utilisée pour entraîner un modèle de langage, en vertu d’une identité mathématique et non d’une simple convention. Elle est égale à l’entropie des données augmentée de la divergence KL des données par rapport au modèle. Les données étant fixées, réduire l’entropie croisée revient donc nécessairement à réduire la divergence KL. Chargez Zipf naturel : l’entropie vaut 4,87 bits, l’entropie croisée 6,08, et leur écart de 1,21 est exactement la divergence KL. La perplexité exprime la même valeur sur une échelle plus intuitive : 24,87 = 29,29. La divergence KL intervient aussi dans l’apprentissage par renforcement à partir de retours humains, comme pénalité maintenant le modèle aligné proche de son modèle initial.

Ce que l'entropie mesure vraiment : la surprise 🖖

L'entropie évalue à quel point un texte est imprévisible – la « surprise » moyenne portée par chaque token. La perplexité traduit cela en un nombre intuitif : une perplexité de 8 signifie que le modèle est, en moyenne, aussi incertain que s'il choisissait uniformément parmi 8 mots. Comparez une invite répétitive à une prose variée et observez la perplexité grimper : un texte prévisible obtient un score bas, un texte varié un score élevé.

Shannon a mesuré l'anglais par un jeu de devinettes 🖖

En 1951, Claude Shannon a estimé l'entropie de l'anglais non pas avec un ordinateur, mais avec des humains : les sujets devinaient la lettre suivante d'un texte caché, et leur taux de réussite a borné l'anglais autour de 0.6 à 1.3 bit par caractère. Ce chiffre reste la référence : on juge les LLM modernes à la proximité de leur perplexité par caractère avec cette limite issue de l'humain, soixante-dix ans plus tard.

Problème entièrement résolu

  1. D'où viennent les quatre valeurs d'entropie sur le panneau 5 étapes

    Entropie 4,87 bits, perplexité 29,29, entropie croisée 6,08, divergence KL 1,21. Quatre nombres sur le panneau et deux seulement sont indépendants. Trouvez les deux relations exactes qui les lient.

    1. L'entropie est la surprise moyenne de la vraie distribution, mesurée en bits : le nombre de questions oui/non nécessaires par jeton si vous encodez de manière optimale pour ce texte.

    2. La perplexité ramène simplement cela à une échelle plus intuitive — deux à la puissance de l'entropie. Elle répond à la question « combien d'options équiprobables donneraient cette même incertitude ? », et 29,29 est plus facile à se représenter que 4,87 bits.

    3. L'entropie croisée est le coût d'encodage de la vraie distribution en utilisant un code conçu pour une distribution différente. Elle n'est jamais inférieure à l'entropie, car le code optimal pour P est optimal.

    4. L'excès est la divergence KL, et il s'agit d'une soustraction, non d'un calcul séparé : 6,08388 − 4,87254 = 1,21134, jusqu'au dernier chiffre affiché.

    5. Passer cet excès à l'exponentielle indique ce qu'il coûte en termes pratiques. 2^1,21 vaut 2,32, donc utiliser le mauvais modèle revient à faire face à 2,32 fois plus de choix par mot — 29,29 devient 67,8.

    Réponse

    L'outil affiche H = 4,87254, PP = 29,2942, H(P,Q) = 6,08388 et DKL = 1,21134. Les deux identités — la perplexité est 2^H, et KL est l'entropie croisée moins l'entropie — s'appliquent à toute paire de distributions ; ce sont donc des vérifications que vous pouvez effectuer sur n'importe quel rapport de modèle qu'on vous remet. Elles expliquent également pourquoi les modèles de langue sont évalués par l'entropie croisée plutôt que par la divergence KL : la divergence KL nécessite la vraie distribution, que personne ne possède, tandis que l'entropie croisée n'a besoin que de la probabilité attribuée par le modèle au texte réellement produit. Minimiser l'une revient à minimiser l'autre, car la différence est une constante sur laquelle le modèle n'a aucune prise.

Références (3)

Exemples de problèmes

  • Salut vulcain (uniforme) - Seize jetons répartis entre six types : l’entropie vaut 2,50 bits et la perplexité 5,66, soit les valeurs les plus faibles ici malgré le nom de l’échantillon. Le texte de comparaison est identique, donc la divergence KL vaut exactement 0.
  • Rhétorique de Trump (répétitive) - Vingt-huit jetons répartis entre quinze types donnent une entropie de 3,59 et une perplexité de 12,08, supérieures à celles de Mots uniformes. Ici, répétitif désigne la reprise de phrases, et non un vocabulaire restreint.
  • Monologue Star Trek (naturel) - Trente-huit jetons répartis entre trente-deux types : l’entropie vaut 4,87 bits et la perplexité 29,29, les valeurs les plus élevées de l’outil. C’est l’état utilisé dans l’exercice corrigé.
  • Science-fiction vs politique (changement de domaine) - L’entropie vaut 4,01 et la perplexité 16,13, avec un texte de comparaison provenant d’un autre domaine. Ce décalage porte l’entropie croisée au-dessus de l’entropie ; leur écart correspond à la divergence KL.