Ülesanne täielikult lahendatud
-
Kaksteist võimalikku jätku, mis katavad 13,6% tegelikult järgnevast 5 sammu
Kaksteist kandidaatjätku katavad 13,6% sellest, mis tegelikult sellele kontekstile järgneb. Tehke kindlaks, milline näeb välja ülejäänud 86%, ja miks see kuju määrab, kuidas valimivõtt peab töötama.
-
Korpus pakub sellele kontekstile 1280 erinevat jätku. See ongi tegelik jaotus, mida mudel üritab jäljendada, ja see on palju laiem kui ükskõik milline lühinimekiri.
-
Parimad kaksteist — need, mida paneel hindab — moodustavad omavahel kokku 13,6% kõigist esinemistest.
-
Nii et ülejäänud 1268 jätku jagavad omavahel 86,4%. Ükski neist pole eraldiseisvalt tõenäoline, kuid kollektiivselt moodustavad need suurema osa toimumisest.
-
See tähendab, et 99,1% valikutest hoiab enda käes 86,4% tõenäosusest: see on pikk saba, mitte tipp koos müraga selle ümber.
-
Kui top-k on välja lülitatud, jäävad alles kõik kaksteist ning paneel näitab, et säilinud on 100% tõenäosusest. See 100% on arvutatud valikloendi piires, 13,6% aga kogu korpuse suhtes. Seega kärbib iga selle lehe filter jaotuse tippu: 1 268 sabasse kuuluvat jätku olid kadunud juba enne ühegi liuguri liigutamist.
Vastus
Tööriist näitab, et alles jäi 12 / 12 jätku, säilis 100,0% tõenäosusest, eri jätke on 1 280 ja kaetus on 13,6%. Just saba teeb valimi võtmise keeruliseks. Kui valida alati kõige tõenäolisem sõne, muutub tekst korduvaks, sest valik tehakse lõputult sama 13,6% seast. Kui võtta valim kogu jaotusest, satub varem või hiljem ette midagi absurdset, sest 86,4% tõenäosusmassist kuulub valikutele, millest igaüks eraldi on väga halb. Top-k ja top-p võimaldavad saba kärpida ilma jaotuse tippu lamedaks muutmata; ülal toodud arvud näitavadki nendevahelist kompromissi. Jälgi, kuidas temperatuur seda mõjutab: määra top-p väärtuseks 90 ja kaheteistkümnest jääb alles kümme, seejärel tõsta temperatuur väärtusele 1,50 ning lisandub üheteistkümnes. Jaotuse lamedamaks muutudes tuum laieneb, mitte ei ahene.
-
Õpitee
Kuidas LLM järgmise sõna valib
Allikad (2)
- Where the temperature in a softmax comes from — it is the one in the Boltzmann distribution: D. H. Ackley, G. E. Hinton and T. J. Sejnowski, "A Learning Algorithm for Boltzmann Machines." Cognitive Science 9(1), 147–169, 1985.
- Why lowering the temperature is not the same as improving the text, and what nucleus sampling does instead: A. Holtzman, J. Buys, L. Du, M. Forbes and Y. Choi, "The Curious Case of Neural Text Degeneration." ICLR 2020.