漢字頻度・確率エクスプローラー

実際の日本語テキストに現れる文字の95%をカバーするには、漢字は何字必要でしょうか?

インタラクティブシミュレーションを読み込んでいます...

レッスン

理論 — 漢字頻度・確率エクスプローラー

これは単に文字数を数える問題ではなく、カバー率についての問いです。ごく一部の文字が頻繁に使われ、大半の文字はめったに使われないという状況において、書かれた文章全体の一定割合を理解するには、頻出上位の文字を何文字覚える必要があるでしょうか。その答えは全文字数よりもはるかに少なく、その理由は文字の出現頻度が極めて偏っているからです。

各記号の意味

rank
出現頻度の高い順にすべての文字を並べたときの、ある文字の順位。順位 1 が最も頻出する文字です。
coverage
ある順位までの文字が占める全出現回数の割合 — 文字の個数ではなく、出現頻度の累積合計です。
required
目標とするカバー率を達成するために必要な、頻出上位の文字数。上の表は、選択したカバー率をその文字数に変換します。
known
すでに覚えていると仮定する文字数。このページではこれを用いて、現在の推定カバー率を表示します。

表示の読み方

この表は語学力の価格表のように読むことができます。50% のカバー率に必要なコストは 158 漢字、80%55890%87295%1,162、そして 99%1,651 です。行そのものよりも行間の差に着目すると、言語の構造が見えてきます。

前提
単一の固定されたコーパスを前提としています。出現頻度とは抽象的な言語そのものの性質ではなく、集計対象となったテキストの性質です — 新聞コーパス、マンガコーパス、法律文書コーパスでは、それぞれ末尾の順位が入れ替わり、表の中のすべての数値が変動します。
成り立たない場合
学習のリターン(費用対効果)は急減しますが、その減衰の仕方は計画を立てる上で非常に有益です。最初の 158 文字で全体の半分をカバーできます。カバー率を 90% から 95% に上げるにはさらに 290 文字が必要であり、最後の 1% — 99% カバー率から完全達成まで — にかかるコストは、50% から 90% までの道のり全体よりも大きくなります。ロングテールが途切れる順位というものは存在せず、1文字追加で覚えるために費やす1時間の価値が見合わなくなる点が存在するだけです。

この一覧が、復習できる間隔そのものを決めている 🖖

頻度順位はふつう重要度として読まれますが、もっと実務的なことを決めています。次に出会うまでどれだけ待つか、です。このツールのコーパスでは、1 位の人は 62 字に 1 回、500 位の休は 2,051 字に 1 回、1,500 位の騎は 15,428 字に 1 回現れます。10,000 字の短編を読んで、その 1,500 位の字に一度でも出会える確率は 47.7 % です。覚えたのに二度と出会わないのは不運ではなく普通の結果で、教科書の順ではなく頻度順に進める理由になります。2,136 字の常用漢字のうち 19 字は、標本とした 709,707 字のなかに一度も現れません。ただし標本が何かは知っておく価値があります。主に 20 世紀初頭の文学作品 60 編で、現代のニュースや技術文書ではありません。

カバー率は「読解」ではない 🖖

カバー率とは、知っている漢字の集合が本文中の漢字の出現のうちどれだけを占めるかを示す割合です。頻度上位の約1,162字を覚えれば、このコーパスの漢字の約95%を認識できます。しかし文法や語彙が未知なら、見慣れた漢字だらけのページでも読めません。カバー率は出会う文字の割合であって、理解度ではありません。

同じ漢字に二つの確率 🖖

「ある漢字が15画以上である確率は?」には二つの正しい答えがあります。辞書から漢字を一様に選ぶ(異なり字)と複雑な字はかなりの割合を占めますが、実際の文章から一つの出現を選ぶ(延べ字)と、そうした字はずっとまれです。読む文字は単純な字(人・日・一)に偏るからです。この「異なり」と「延べ」の差は頻度で重み付けした標本抽出であり、「友達の逆説」と同じ仕組みです。

全プロセスの詳細解説

  1. このコーパスを77.39%カバーする500の漢字 6 ステップ

    漢字500字でこのコーパスの77.39%をカバーできる。これがテキスト1ページにとって何を意味するのかを算出し、次いでそのギャップを埋めるためのコストを求めよ。

    1. カバー率とその補数は同一の事実を表している。補数の逆数は未知の漢字の平均出現間隔であり、これこそが実際の読書体験がどのような感覚であるかを伝える形式である。

    2. これを作品全体に拡大して考える。コーパスのヘッダーに出現回数と作品数が記載されているため、計算にはこのページ以外の情報は一切必要ない。

    3. 次はコスト曲線である。パネルには5つのカバー率目標に必要な漢字数が一覧表示されており、着目すべき量は隣り合う行の差分である。

    4. 獲得したカバー率を費やした漢字数で割る。その効率は2つの区間の間で半減する。

    5. 常用漢字表の残りの部分は極端な事例である。文字全体の5分の1を使って、テキストの100分の1をカバーする。

    6. 目標を逆から捉えてみる。4.4字に1字ではなく作品1冊につき未知の漢字1字で読書を行うには、9が4つ並ぶカバー率が必要となり、これは2,136字の固定リストでは到底達成できない。

    解答

    4.4字に1字が未知の漢字で、最後の1%を埋めるには、90%から95%まで伸ばすときの1字当たり8倍の労力がかかる。頻度上位158字だけで、コーパスの半分を読める。90%から95%までを担う290字は、1字覚えるごとにカバー率を0.017ポイント押し上げる。95%から99%までの489字では0.008ポイント。残る485字では、わずか0.002ポイントにすぎない。文章の百分の一を埋めるために、全字種の五分の一を覚える計算だ。ロングテール型の頻度分布は必ずこの形になり、言語学習の費用対効果を左右する。最初の千字は、教育全体を見渡しても屈指の投資である。一方、最後の五百字は網羅を目指す人の趣味の領域だ。カバー率77%が77%ほど読める感覚にならない理由も、ここにある。4.4字に1字を読めなければ、このコーパスの平均的な作品ではおよそ2,700回つまずく。それでは読書にならない。

参考文献 (2)

例題