レッスン
理論 — 漢字頻度・確率エクスプローラー
これは単に文字数を数える問題ではなく、カバー率についての問いです。ごく一部の文字が頻繁に使われ、大半の文字はめったに使われないという状況において、書かれた文章全体の一定割合を理解するには、頻出上位の文字を何文字覚える必要があるでしょうか。その答えは全文字数よりもはるかに少なく、その理由は文字の出現頻度が極めて偏っているからです。
各記号の意味
rank- 出現頻度の高い順にすべての文字を並べたときの、ある文字の順位。順位 1 が最も頻出する文字です。
coverage- ある順位までの文字が占める全出現回数の割合 — 文字の個数ではなく、出現頻度の累積合計です。
required- 目標とするカバー率を達成するために必要な、頻出上位の文字数。上の表は、選択したカバー率をその文字数に変換します。
known- すでに覚えていると仮定する文字数。このページではこれを用いて、現在の推定カバー率を表示します。
表示の読み方
この表は語学力の価格表のように読むことができます。50% のカバー率に必要なコストは 158 漢字、80% は 558、90% は 872、95% は 1,162、そして 99% は 1,651 です。行そのものよりも行間の差に着目すると、言語の構造が見えてきます。
- 前提
- 単一の固定されたコーパスを前提としています。出現頻度とは抽象的な言語そのものの性質ではなく、集計対象となったテキストの性質です — 新聞コーパス、マンガコーパス、法律文書コーパスでは、それぞれ末尾の順位が入れ替わり、表の中のすべての数値が変動します。
- 成り立たない場合
- 学習のリターン(費用対効果)は急減しますが、その減衰の仕方は計画を立てる上で非常に有益です。最初の
158文字で全体の半分をカバーできます。カバー率を 90% から 95% に上げるにはさらに290文字が必要であり、最後の 1% — 99% カバー率から完全達成まで — にかかるコストは、50% から 90% までの道のり全体よりも大きくなります。ロングテールが途切れる順位というものは存在せず、1文字追加で覚えるために費やす1時間の価値が見合わなくなる点が存在するだけです。
全プロセスの詳細解説
-
このコーパスを77.39%カバーする500の漢字 6 ステップ
漢字500字でこのコーパスの77.39%をカバーできる。これがテキスト1ページにとって何を意味するのかを算出し、次いでそのギャップを埋めるためのコストを求めよ。
-
カバー率とその補数は同一の事実を表している。補数の逆数は未知の漢字の平均出現間隔であり、これこそが実際の読書体験がどのような感覚であるかを伝える形式である。
-
これを作品全体に拡大して考える。コーパスのヘッダーに出現回数と作品数が記載されているため、計算にはこのページ以外の情報は一切必要ない。
-
次はコスト曲線である。パネルには5つのカバー率目標に必要な漢字数が一覧表示されており、着目すべき量は隣り合う行の差分である。
-
獲得したカバー率を費やした漢字数で割る。その効率は2つの区間の間で半減する。
-
常用漢字表の残りの部分は極端な事例である。文字全体の5分の1を使って、テキストの100分の1をカバーする。
-
目標を逆から捉えてみる。4.4字に1字ではなく作品1冊につき未知の漢字1字で読書を行うには、9が4つ並ぶカバー率が必要となり、これは2,136字の固定リストでは到底達成できない。
解答
4.4字に1字が未知の漢字で、最後の1%を埋めるには、90%から95%まで伸ばすときの1字当たり8倍の労力がかかる。頻度上位158字だけで、コーパスの半分を読める。90%から95%までを担う290字は、1字覚えるごとにカバー率を0.017ポイント押し上げる。95%から99%までの489字では0.008ポイント。残る485字では、わずか0.002ポイントにすぎない。文章の百分の一を埋めるために、全字種の五分の一を覚える計算だ。ロングテール型の頻度分布は必ずこの形になり、言語学習の費用対効果を左右する。最初の千字は、教育全体を見渡しても屈指の投資である。一方、最後の五百字は網羅を目指す人の趣味の領域だ。カバー率77%が77%ほど読める感覚にならない理由も、ここにある。4.4字に1字を読めなければ、このコーパスの平均的な作品ではおよそ2,700回つまずく。それでは読書にならない。
-
参考文献 (2)
- The corpus every number here is counted from — a sample of public-domain Japanese literary works: Aozora Bunko (青空文庫), public-domain Japanese texts. Counts restricted to the Jōyō kanji set.
- Per-character metadata (readings, grade, stroke count): KANJIDIC2, Electronic Dictionary Research and Development Group (EDRDG), used under CC BY-SA 4.0.