Laboratoire d'entropie en TAL

Visualise les distributions de probabilité des tokens, l'entropie de Shannon, la perplexité, l'entropie croisée et la divergence KL — les métriques mathématiques fondamentales utilisées pour entraîner et évaluer les grands modèles de langage (LLM) d'IA.

Chargement de la simulation interactive...

Mathématiques approfondies de la théorie de l'information et des LLM d'IA 🖖

L'entropie de Shannon, l'entropie croisée, la perplexité et la divergence KL sont les métriques mathématiques fondamentales utilisées pour entraîner et évaluer les grands modèles de langage (LLM) d'IA comme GPT-4 et Llama. Minimiser l'entropie croisée équivaut à entraîner le modèle à prédire le token suivant, tandis que la perplexité mesure sa performance en évaluation, et la divergence KL est utilisée comme pénalité dans l'alignement par apprentissage par renforcement RLHF.

Ce que l'entropie mesure vraiment : la surprise 🖖

L'entropie évalue à quel point un texte est imprévisible – la « surprise » moyenne portée par chaque token. La perplexité traduit cela en un nombre intuitif : une perplexité de 8 signifie que le modèle est, en moyenne, aussi incertain que s'il choisissait uniformément parmi 8 mots. Comparez une invite répétitive à une prose variée et observez la perplexité grimper : un texte prévisible obtient un score bas, un texte varié un score élevé.

Shannon a mesuré l'anglais par un jeu de devinettes 🖖

En 1951, Claude Shannon a estimé l'entropie de l'anglais non pas avec un ordinateur, mais avec des humains : les sujets devinaient la lettre suivante d'un texte caché, et leur taux de réussite a borné l'anglais autour de 0.6 à 1.3 bit par caractère. Ce chiffre reste la référence : on juge les LLM modernes à la proximité de leur perplexité par caractère avec cette limite issue de l'humain, soixante-dix ans plus tard.

Exemples de problèmes