Problème entièrement résolu
-
Douze suites candidates qui couvrent 13,6 % de ce qui suit réellement 5 étapes
Douze continuations candidates couvrent 13,6 % de ce qui suit réellement ce contexte. Déterminez à quoi ressemblent les autres 86 %, et pourquoi cette forme décide de la manière dont l'échantillonnage doit fonctionner.
-
Le corpus offre 1 280 continuations distinctes de ce contexte. C'est la distribution réelle que le modèle tente d'imiter, et elle est bien plus large que n'importe quelle liste restreinte.
-
Les douze meilleures — celles que le panneau évalue — représentent à elles seules 13,6 % de toutes les occurrences.
-
Ainsi, les 1 268 continuations restantes se partagent 86,4 %. Aucune d'entre elles n'est probable prise isolément, et collectivement elles représentent la majeure partie de ce qui se produit.
-
C'est-à-dire 99,1 % des options qui détiennent 86,4 % de la probabilité : une longue traîne, et non un pic entouré de bruit.
-
Lorsque top-k est désactivé, les douze éléments sont conservés et le panneau indique que 100 % de la probabilité est retenue. Ce taux de 100 % est calculé au sein de la sélection restreinte, tandis que les 13,6 % se rapportent au corpus entier. Tous les filtres de cette page agissent donc sur la tête de la distribution : les 1 268 continuations de la traîne avaient déjà été écartées avant même que vous ne déplaciez un curseur.
Réponse
L’outil affiche 12 / 12 éléments conservés, 100,0 % de probabilité retenue, 1 280 continuations distinctes et une couverture de 13,6 %. Toute la difficulté de l’échantillonnage vient de la traîne. Si vous choisissez toujours le token le plus probable, le texte finit par se répéter, car vous restez indéfiniment cantonné aux 13,6 %. Si vous échantillonnez dans l’ensemble de la distribution, vous finirez par tirer une option absurde : 86,4 % de la masse est répartie entre des possibilités qui, prises séparément, sont très mauvaises. Top-k et top-p servent à retrancher la traîne sans aplatir la tête de la distribution ; les valeurs ci-dessus rendent compte du compromis recherché. Observez l’effet de la température : réglez top-p sur 90, et dix éléments sur douze subsistent. Augmentez ensuite la température à 1,50 ; un onzième réapparaît, car l’aplatissement de la distribution élargit le noyau.
-
Parcours
Comment un LLM choisit le mot suivant
Références (2)
- Where the temperature in a softmax comes from — it is the one in the Boltzmann distribution: D. H. Ackley, G. E. Hinton and T. J. Sejnowski, "A Learning Algorithm for Boltzmann Machines." Cognitive Science 9(1), 147–169, 1985.
- Why lowering the temperature is not the same as improving the text, and what nucleus sampling does instead: A. Holtzman, J. Buys, L. Du, M. Forbes and Y. Choi, "The Curious Case of Neural Text Degeneration." ICLR 2020.