BPE-tokeniseerija uurija

Keelemudel ei näe kunagi sinu tähti. Ta näeb tokeneid, mille määrab sõnavara, mis fikseeriti ammu enne sinu kirjutamist. Kleebi tekst ja vaata, kuidas see sõnavara selle tükeldab.

Interaktiivse simulatsiooni laadimine...

Sõnavara kuulub kellelegi teisele ja on juba valmis 🖖

Selle lehe liitmisloend koostati enne sinu saabumist, selle saidi ingliskeelsest proosast, ja miski, mida sa kirjutad, ei muuda seda. See ei ole otsetee — just see tokeniseerija ongi. Sõnavara on paigas juba enne mudeli treenimise algust ja see ei saa sinu jaoks kasvada: sõnal, mida too korpus kunagi ei sisaldanud, ei ole oma kirjet, ükskõik kui tavaline see sinu jaoks on. Kirjuta nimi, erialatermin või mõne teise keele sõna ja vaata, kuidas see tükkidena kohale jõuab.

Tühik kuulub tokeni juurde 🖖

Token, mis alustab sõna, kannab endaga kaasa selle ees olevat tühikut, mida siin näidatakse kujul ␣. Nii on „the“ rea alguses ja „ the“ rea keskel sõnavaras kaks eri kirjet ning mudel peab mõlemad ära õppima. Seetõttu võib lõigu ümberpaigutamine muuta selle tokenite arvu ilma ühtki tähte muutmata, ja seetõttu maksab topelttühikute või taandega kleebitud tekst rohkem, kui välja näeb.

Mudel ei näe tokeni sees olevaid tähti 🖖

Token jõuab mudelini ühe arvuna. „strawberry“ muutub siin kujuks ▁stra · w · ber · ry — neli arvu, ja sõna kolm r-tähte satuvad neist kolme erinevasse. Küsimus, mitu r-tähte sõnas on, nõuab mudelilt pilku tükkide sisse, mille ta saab alati tervikuna. Sageli vastab ta siiski õigesti, sest on vastust kusagilt lugenud. See on meenutamine, mitte loendamine, ja just seepärast tundub viga nii veider, kui see tuleb.

Ülesanne täielikult lahendatud

  1. Tihendus, kui kuuskümmend kaheksa tähemärki muutub kolmeteistkümneks tookeniks 5 sammu

    Kuuskümmend kaheksa märki muutuvad kolmeteistkümneks märgiseks. Arvutage tihendus ja seejärel see, mida need viis märki märgise kohta mudelile tegelikult väärt on.

    1. Need kaks arvu ongi kogu mõõtmine: märgid sisse, märgised välja.

    2. Nende suhe on veidi üle viie, mis on inglise keele puhul baitpaaride kodeerimisel tüüpiline — sagedased sõnad jäävad püsima üheainsa märgisena ja haruldased fragmenteeruvad.

    3. Oluline võrdlus on alternatiiviga. Baiditaseme mudel loeb sama teksti 68 märgisena, mis on üle viie korra pikem jadapikkus.

    4. Tähelepanumaatriksis on n² elementi, seega tähendab pikkuse kasv 5,23 korda selles tööosas 27-kordset kasvu. Ülejäänud võrgu arvutusmaht sõltub n-ist lineaarselt ja väheneb 5,23 korda. Kumb neist määravaks saab, oleneb konteksti pikkusest: tähelepanuarvutus hakkab domineerima alles siis, kui sõnesid on üle mõne tuhande.

    5. Kõik kolmteist märgist on siin erinevad, mis näitab, et tekst on lühike ja mitmekesine — liitmiste jaoks pole kordumist, mida ära kasutada väljaspool seda, mida sõnavara juba kodeerib.

    Vastus

    Tööriist näitab, et 68 märgist saab 13 sõnet ehk ühe sõne kohta tuleb 5,23 märki. Just sellise tihendamise pärast tokeniseerimist üldse kasutatakse ning seepärast pole see tühine tehniline üksikasi: sama kontekstipiirang mahutab kas viis lehekülge teksti või ainult ühe. Seetõttu on sama mudeli kasutamine inglise keeles ka odavam kui keeltes, mille jaoks sõnavara ei loodud. Liitmisreeglid õpiti korpusest, nii et seal vähe esindatud kirjasüsteem laguneb baitidele lähemateks osadeks ja suurendab arvutuskulu mõlemal viisil: kogu võrgus lineaarselt ning tähelepanuarvutuses ruutvõrdeliselt. Kleebi tööriista mõnes muus keeles tekst ja vaata, kuidas suhtarv väheneb.

Õpitee

Kuidas LLM järgmise sõna valib

Viib edasi token-embeddings sõnavara — kinnise hulga kirjeid, millele kõik edasine üldse tõenäosust külge panna saab.

Allikad (2)

Näiteülesanded

  • Ingliskeelne proosa - 68 märgist saab 13 tokenit. Sagedased sõnad nagu „of“ ja „a“ püsivad tervikuna, „quickly“ aga murdub pärast osa „quick“.
  • Sama lause saksa keeles - 69 märgist — ühe võrra rohkem kui ingliskeelses lauses — saab 36 tokenit. Sõnavara treeniti inglise keele peal ja saksa keel maksab selle kinni.
  • Haruldased ja pikad sõnad - 52 märgist saab 23 tokenit. „strawberry“ jõuab kohale nelja tükina, nii et mudelile ei näidata kunagi selle kolme eraldi r-tähte.
  • Numbrid ja kuupäevad - 50 märgist saab 31 tokenit. Numbrid jagunevad nendeks paarideks, mis korpuses juhtusid esinema, ja just seepärast on mudelil pikkade arvudega rehkendamine raske.
  • Inglise keel, väike sõnavara - Sama ingliskeelne lause mis esimeses näites, 200 liitmisega 3000 asemel: 33 tokenit 13 asemel.