Kanji sageduse ja tõenäosuse uurija

kui palju kanji katab 95% märkidest tegelikus jaapani tekstis?

Interaktiivse simulatsiooni laadimine...

Õppetund

Teooria — Kanji sageduse ja tõenäosuse uurija

See on kaetuse, mitte loendamise küsimus: arvestades, et mõnda üksikut märki kasutatakse pidevalt ning enamikku harva, mitut kõige sagedasemat märki on vaja teada, et tunda ära teatud osa kogu tekstist? Vastus on – oluliselt vähem kui kõiki kokku, ning põhjuseks on see, et märkide esinemissagedus on äärmiselt ebaühtlane.

Mida iga sümbol tähendab

rank
märgi positsioon, kui kõik märgid on järjestatud esinemissageduse järgi. 1. koht on kõige sagedasem.
coverage
kõigi esinemiste osakaal, mille moodustavad kõik märgid kuni teatud positsioonini — sageduse kumulatiivne summa, mitte märkide arv.
required
mitu kõige sagedasemat märki on vaja teada soovitud kaetuse saavutamiseks. Ülalolev tabel teisendab sinu valitud kaetuse selleks arvuks.
known
mitut märki sa eeldad end juba teadvat; leht kasutab seda arvu sinu praeguse kaetuse kuvamiseks.

Kuidas nähtut lugeda

Tabel on loetav nagu keeleoskuse hinnakiri: 50% kaetus maksab 158 kanjit, 80% maksab 558, 90% maksab 872, 95% maksab 1,162 ja 99% maksab 1,651. Loe pigem vahesid kui ridu ja nähtavale ilmub keele kuju.

Eeldab
Üks fikseeritud korpus. Sagedus on loendatud tekstide, mitte abstraktse keele omadus — ajalehekorpus, mangakorpus ja õigustekstide korpus muudaksid igaüks saba järjestust ning nihutaksid kõiki arve selles tabelis.
Ei kehti, kui
Tasuvus kahaneb ning teeb seda viisil, millega tasub arvestada. Esimesed 158 märki annavad sulle poole kõigest. Liikumine 90%-lt 95%-le maksab veel 290 ning viimane 1% — 99% kaetuselt täielikuni — maksab rohkem kui kogu teekond 50%-lt 90%-le. Ei ole olemas positsiooni, kus saba lõppeks, on vaid punkt, kus iga täiendav märk ei ole enam väärt selleks kuluvat tundi.

Nimekiri otsustab, kui tihti te üldse saate korrata 🖖

Sagedusjärku loetakse tavaliselt tähtsusena, kuid see määrab midagi praktilisemat: kui kaua te kahe kohtumise vahel ootate. Selle tööriista korpuses ilmub 人 järjekohal 1 üks kord iga 62 kanji kohta, 休 järjekohal 500 üks kord iga 2051 kohta ja 騎 järjekohal 1500 üks kord iga 15 428 kohta. Lugege 10 000 märgiga lugu ja tõenäosus kohata seda 1500. järjekoha märki kas või korra on 47,7% — selle õppimine ja siis mitte kunagi uuesti nägemine on seega tavapärane tulemus, mitte halb õnn, ning see on argument järgida sagedusjärjestust, mitte õpiku oma. Üheksateist 2136 jōyō kanjist ei esine 709 707 valimisse võetud märgi hulgas üldse. Tasub siiski teada, mis valim see on: 60 teost peamiselt 20. sajandi alguse ilukirjandust, mitte tänapäeva uudised ega tehnilised tekstid.

Katvus pole mõistmine 🖖

Katvus näitab, kui suure osa tekstis esinevatest kanji-märkidest moodustab sulle juba tuntud märkide hulk. Kui õpid selgeks 1,162 sagedasemat kanjit, tunned ära umbes 95% selle korpuse kanji-märkidest. Kuid tuttavaid märke täis lehekülg võib jääda loetamatuks, kui grammatika ja sõnavara on võõrad. Katvus mõõdab kohatavaid märke, mitte sinu arusaamist.

Sama kanji, kaks tõenäosust 🖖

Küsimusel "kui tõenäoline on, et kanjil on 15 või enam tõmmet?" on kaks õiget vastust. Kui valid sõnastikust märgi ühtlaselt (tüübid), on keerukad märgid arvestatav osa; kui valid esinemise päris tekstist (esinemised), on need palju haruldasemad, sest loetavad märgid kalduvad olema lihtsad (人, 日, 一). See lõhe tüüpide ja esinemiste vahel on sagedusega kaalutud valim — sama mehhanism kui sõprusparadoksis.

Ülesanne täielikult lahendatud

  1. 500 kanjit, mis annavad sellele korpusele 77,39% katvuse 6 sammu

    500 kanjit annab selle korpuse katvuseks 77,39%. Arvuta välja, mida see tähendab tekstilehekülje jaoks ning mida maksab selle lünga sulgemine.

    1. Katvus ja selle täiend väljendavad sama tõsiasja. Täiendi pöördväärtus on tundmatute märkide keskmine vahekaugus ning just sellisel kujul avaldub see, mis tunne on tegelikult lugeda.

    2. Skaleeri see tervele teosele. Korpuse päises on toodud esinemiste arv ja teoste arv, seega ei vaja tehe midagi väljastpoolt lehte.

    3. Nüüd kulukõver. Paneelis on toodud viie katvuseesmärgi saavutamiseks vajalik kanjide arv ning huvipakkuv suurus on järjestikuste ridade vahe.

    4. Jaga saadud katvus kulutatud kanjide arvuga. Kahe vahemiku vahel see määr poolestub.

    5. Jōyō-nimekirja ülejäänud osa on äärmuslik juhtum: viiendik märkidest sajandiku teksti eest.

    6. Pööra eesmärk vastupidiseks. Lugemine nii, et teose kohta on vaid üks tundmatu märk (mitte üks 4,4 kanji kohta), tähendab katvusnäitajat, milles on neli üheksat – seda ei suuda tagada ükski kindlaksmääratud 2 136 märgist koosnev nimekiri.

    Vastus

    Iga 4,4 märgi kohta tuleb üks tundmatu kanji ning viimase 1% omandamine nõuab ühe kanji kohta kaheksa korda rohkem tööd kui 90%-lt 95%-le jõudmine. Esimesed 158 kanjit annavad ligipääsu poolele korpusest. Need 290, millega katvus kasvab 90%-lt 95%-le, lisavad igaüks 0,017 protsendipunkti. Järgmised 489, mis viivad katvuse 95%-lt 99%-le, lisavad igaüks 0,008 protsendipunkti. Ülejäänud 485 annavad aga vaid 0,002 protsendipunkti märgi kohta: viiendik kogu märgistikust ühe sajandiku teksti nimel. Selline on alati pika sabaga sagedusjaotus ning sellest sõltub, kuidas tasub keelt õppida. Esimesed tuhat kirjamärki on hariduses erakordselt tulus investeering, viimased viissada pakuvad huvi peamiselt neile, kes tahavad märgistiku täielikult omandada. See selgitab ka, miks 77% katvus ei tundu lugedes sugugi 77%-na. Üks tundmatu kanji iga 4,4 märgi kohta tähendab selle korpuse keskmises teoses ligikaudu 2,700 takerdumist. Seda ei saa veel lugemiseks nimetada.

Allikad (2)

Näiteülesanded