Ülesanne täielikult lahendatud
-
Tihendus, kui kuuskümmend kaheksa tähemärki muutub kolmeteistkümneks tookeniks 5 sammu
Kuuskümmend kaheksa märki muutuvad kolmeteistkümneks märgiseks. Arvutage tihendus ja seejärel see, mida need viis märki märgise kohta mudelile tegelikult väärt on.
-
Need kaks arvu ongi kogu mõõtmine: märgid sisse, märgised välja.
-
Nende suhe on veidi üle viie, mis on inglise keele puhul baitpaaride kodeerimisel tüüpiline — sagedased sõnad jäävad püsima üheainsa märgisena ja haruldased fragmenteeruvad.
-
Oluline võrdlus on alternatiiviga. Baiditaseme mudel loeb sama teksti 68 märgisena, mis on üle viie korra pikem jadapikkus.
-
Tähelepanumaatriksis on n² elementi, seega tähendab pikkuse kasv 5,23 korda selles tööosas 27-kordset kasvu. Ülejäänud võrgu arvutusmaht sõltub n-ist lineaarselt ja väheneb 5,23 korda. Kumb neist määravaks saab, oleneb konteksti pikkusest: tähelepanuarvutus hakkab domineerima alles siis, kui sõnesid on üle mõne tuhande.
-
Kõik kolmteist märgist on siin erinevad, mis näitab, et tekst on lühike ja mitmekesine — liitmiste jaoks pole kordumist, mida ära kasutada väljaspool seda, mida sõnavara juba kodeerib.
Vastus
Tööriist näitab, et 68 märgist saab 13 sõnet ehk ühe sõne kohta tuleb 5,23 märki. Just sellise tihendamise pärast tokeniseerimist üldse kasutatakse ning seepärast pole see tühine tehniline üksikasi: sama kontekstipiirang mahutab kas viis lehekülge teksti või ainult ühe. Seetõttu on sama mudeli kasutamine inglise keeles ka odavam kui keeltes, mille jaoks sõnavara ei loodud. Liitmisreeglid õpiti korpusest, nii et seal vähe esindatud kirjasüsteem laguneb baitidele lähemateks osadeks ja suurendab arvutuskulu mõlemal viisil: kogu võrgus lineaarselt ning tähelepanuarvutuses ruutvõrdeliselt. Kleebi tööriista mõnes muus keeles tekst ja vaata, kuidas suhtarv väheneb.
-
Õpitee
Kuidas LLM järgmise sõna valib
Allikad (2)
- Byte-pair encoding applied to text, which is where subword tokenisation came from: R. Sennrich, B. Haddow and A. Birch, "Neural Machine Translation of Rare Words with Subword Units." Proceedings of the 54th Annual Meeting of the ACL (Volume 1: Long Papers), 1715–1725, 2016.
- The language-independent scheme most current models actually ship: T. Kudo and J. Richardson, "SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing." Proceedings of EMNLP 2018: System Demonstrations, 66–71, 2018.