NLP entroopia labor

Visualiseeri tokenite tõenäosusjaotusi, Shannoni entroopiat, hämmeldust, ristentroopiat ja KL-divergentsi — põhilisi matemaatilisi mõõdikuid, mida kasutatakse tehisintellekti suurte keelemudelite (LLM) treenimisel ja hindamisel.

Interaktiivse simulatsiooni laadimine...

Ristentroopia minimeerimine on sama mis järgmise tokeni ennustamine 🖖

Keelemudelit treenitakse ristentroopia põhjal ning selle taga on matemaatiline samasus, mitte kokkulepe. Ristentroopia võrdub andmete entroopia ja andmejaotuse ning mudeli vahelise KL-divergentsi summaga. Kui andmed ei muutu, saab ristentroopia väheneda üksnes koos KL-divergentsiga. Laadi loomulik Zipfi jaotus: entroopia on 4,87 bitti ja ristentroopia 6,08; nende vahe 1,21 ongi täpselt KL-divergents. Perplekssus väljendab sama suurust hõlpsamini tajutaval skaalal: 24,87 = 29,29. KL-divergents esineb ka RLHF-is karistusliikmena, mis hoiab joondatud mudeli algse mudeli lähedal.

Mida entroopia tegelikult mõõdab: üllatust 🖖

Entroopia näitab, kui ettearvamatu tekst on – iga tokeni keskmist "üllatust". Perpleksus teisendab selle arusaadavaks arvuks: perpleksus 8 tähendab, et mudel on keskmiselt sama ebakindel, nagu valiks ta ühtlaselt 8 sõna vahel. Võrdle korduvat sisendit vaheldusrikka tekstiga ja jälgi, kuidas perpleksus kasvab: ettearvatav tekst annab madala, mitmekesine tekst kõrge tulemuse.

Shannon mõõtis inglise keelt äraarvamismänguga 🖖

1951. aastal hindas Claude Shannon inglise keele entroopiat mitte arvutiga, vaid inimestega: katsealused arvasid varjatud teksti järgmist tähte ja nende tabamused piirasid inglise keele umbes 0.6 kuni 1.3 bitini tähemärgi kohta. See arv on siiani mõõdupuu – tänapäeva LLM-e hinnatakse selle järgi, kui lähedale jõuab nende perpleksus tähemärgi kohta sellele inimestest tuletatud piirile, seitsekümmend aastat hiljem.

Ülesanne täielikult lahendatud

  1. Kust neli entroopia arvu paneelil pärinevad 5 sammu

    Entroopia 4,87 bitti, perplekssus 29,29, ristentroopia 6,08, KL-divergents 1,21. Paneelil on neli arvu ja neist vaid kaks on sõltumatud. Leidke kaks täpset seost, mis neid ühendavad.

    1. Entroopia on tõelise jaotuse keskmine üllatuse määr bittides: jah/ei-küsimuste arv iga tokeni kohta, kui kodeerida optimaalselt selle teksti jaoks.

    2. Perplekssus viib selle lihtsalt hoomatavamale skaalale — kaks astmes entroopia. See vastab küsimusele „mitu võrdtõenäolist valikut tekitaks sama suure määramatuse?“, ning 29,29 on lihtsam ette kujutada kui 4,87 bitti.

    3. Ristentroopia on tõelise jaotuse kodeerimise kulu, kasutades koodi, mis on loodud teise jaotuse jaoks. See ei ole kunagi entroopiast väiksem, sest P jaoks optimaalne kood on optimaalne.

    4. Ülejääk on KL-divergents ja see on lahutustehe, mitte eraldi arvutus: 6,08388 − 4,87254 = 1,21134 kuni viimase kuvatud numbrini.

    5. Selle ülejäägi astendamine näitab, mida see praktilises mõttes maksab. 2^1,21 on 2,32, seega valemudeli kasutamine on nagu 2,32 korda rohkemate valikute ees seismine sõna kohta — 29,29-st saab 67,8.

    Vastus

    Tööriist kuvab H = 4,87254, PP = 29,2942, H(P,Q) = 6,08388 ja DKL = 1,21134. Kaks samasust — perplekssus on 2^H ning KL on ristentroopia miinus entroopia — kehtivad iga jaotuspaari korral, seega on need kontrolliks, mida saab teha igal teile antud mudeli aruandel. Samuti selgitavad need, miks keelemudeleid hinnatakse ristentroopia, mitte KL-divergentsi järgi: KL vajab tõelist jaotust, mida kellelgi pole, samal ajal kui ristentroopia vajab vaid mudeli antud tõenäosust tegelikult esinenud tekstile. Ühe minimeerimine minimeerib ka teise, sest erinevus on konstant, mida mudel ei saa mõjutada.

Allikad (3)

Näiteülesanded

  • Vulkaani tervitus (ühtlane) - Kuusteist sõnet kuuest tüübist: entroopia on 2,50 bitti ja perplekssus 5,66. Nimetusest hoolimata on need siin kõige väiksemad. Võrdlustekst on täpselt sama, seega on KL-divergents täpselt 0.
  • Trumpi retoorika (korduv) - Kakskümmend kaheksa sõnet viieteistkümnest tüübist annavad entroopiaks 3,59 ja perplekssuseks 12,08. Need on suuremad kui ühtlaste sõnade näites, sest korduvad siin fraasid, mitte väike sõnavara.
  • Star Treki monoloog (loomulik) - Kolmkümmend kaheksa sõnet kolmekümne kahest tüübist: entroopia on 4,87 bitti ja perplekssus 29,29, tööriista suurimad väärtused. Selles olekus on ka lahendatav ülesanne.
  • Ulme vs poliitika (valdkonna nihe) - Entroopia on 4,01 ja perplekssus 16,13, kuid võrdlustekst pärineb teisest valdkonnast. See erinevus tõstab ristentroopia entroopiast suuremaks; nende vahe on KL-divergents.