Problème entièrement résolu
-
D'où viennent les quatre valeurs d'entropie sur le panneau 5 étapes
Entropie 4,87 bits, perplexité 29,29, entropie croisée 6,08, divergence KL 1,21. Quatre nombres sur le panneau et deux seulement sont indépendants. Trouvez les deux relations exactes qui les lient.
-
L'entropie est la surprise moyenne de la vraie distribution, mesurée en bits : le nombre de questions oui/non nécessaires par jeton si vous encodez de manière optimale pour ce texte.
-
La perplexité ramène simplement cela à une échelle plus intuitive — deux à la puissance de l'entropie. Elle répond à la question « combien d'options équiprobables donneraient cette même incertitude ? », et 29,29 est plus facile à se représenter que 4,87 bits.
-
L'entropie croisée est le coût d'encodage de la vraie distribution en utilisant un code conçu pour une distribution différente. Elle n'est jamais inférieure à l'entropie, car le code optimal pour P est optimal.
-
L'excès est la divergence KL, et il s'agit d'une soustraction, non d'un calcul séparé : 6,08388 − 4,87254 = 1,21134, jusqu'au dernier chiffre affiché.
-
Passer cet excès à l'exponentielle indique ce qu'il coûte en termes pratiques. 2^1,21 vaut 2,32, donc utiliser le mauvais modèle revient à faire face à 2,32 fois plus de choix par mot — 29,29 devient 67,8.
Réponse
L'outil affiche H = 4,87254, PP = 29,2942, H(P,Q) = 6,08388 et DKL = 1,21134. Les deux identités — la perplexité est 2^H, et KL est l'entropie croisée moins l'entropie — s'appliquent à toute paire de distributions ; ce sont donc des vérifications que vous pouvez effectuer sur n'importe quel rapport de modèle qu'on vous remet. Elles expliquent également pourquoi les modèles de langue sont évalués par l'entropie croisée plutôt que par la divergence KL : la divergence KL nécessite la vraie distribution, que personne ne possède, tandis que l'entropie croisée n'a besoin que de la probabilité attribuée par le modèle au texte réellement produit. Minimiser l'une revient à minimiser l'autre, car la différence est une constante sur laquelle le modèle n'a aucune prise.
-
Références (3)
- Entropy and cross-entropy, at the source: C. E. Shannon, "A Mathematical Theory of Communication." Bell System Technical Journal 27, 379–423, 1948.
- KL divergence, in the paper that defined it: S. Kullback & R. A. Leibler, "On Information and Sufficiency." The Annals of Mathematical Statistics 22, 79–86, 1951.
- Perplexity, introduced as a measure of task difficulty long before language models: F. Jelinek, R. L. Mercer, L. R. Bahl & J. K. Baker, "Perplexity — a measure of the difficulty of speech recognition tasks." Journal of the Acoustical Society of America 62, S63, 1977.