漢字頻度・確率エクスプローラー

実際の日本語テキストに現れる文字の95%をカバーするには、漢字は何字必要でしょうか?

インタラクティブシミュレーションを読み込んでいます...

概要: 漢字頻度・確率エクスプローラー

日本語の漢字の出現頻度、累積読解カバー率、遭遇確率、画数の統計を探る — 書き言葉としての日本語に統計と確率を応用します。. このツールは「統計・ファイナンス」のカテゴリに分類され、標準的な方程式や規則に基づいて正確な計算結果を提供します。

この計算機には、事前設定されたシミュレーションケースが含まれています:95%を読む(既知); 90%を読む(既知); 最初の100字; 水を調べる; 人を調べる; さんずい 氵; P(15画以上); 自分のテキストを分析

キーワード: kanji, japanese, frequency, cumulative coverage, probability, zipf, entropy, stroke count, descriptive statistics, reading coverage

カバー率は「読解」ではない 🖖

カバー率とは、知っている漢字の集合が本文中の漢字の出現のうちどれだけを占めるかを示す割合です。頻度上位の約1,162字を覚えれば、このコーパスの漢字の約95%を認識できます。しかし文法や語彙が未知なら、見慣れた漢字だらけのページでも読めません。カバー率は出会う文字の割合であって、理解度ではありません。

同じ漢字に二つの確率 🖖

「ある漢字が15画以上である確率は?」には二つの正しい答えがあります。辞書から漢字を一様に選ぶ(異なり字)と複雑な字はかなりの割合を占めますが、実際の文章から一つの出現を選ぶ(延べ字)と、そうした字はずっとまれです。読む文字は単純な字(人・日・一)に偏るからです。この「異なり」と「延べ」の差は頻度で重み付けした標本抽出であり、「友達の逆説」と同じ仕組みです。

例題