全プロセスの詳細解説
-
180語における0.453のターゲット不一致ギャップ 7 ステップ
クラシックモード、180語、シード
spock、目標エントロピー 6.2。パネルは語あたり 5.747 ビットを測定し、目標との乖離 0.453 を報告している。 生成器がその差をどこまで埋められるか、そしてその差のうち、100万語ではなく180語をカウントしたことのみに起因する割合はどれくらいかを算出せよ。-
クラシックモードは、元コーパスの相異なる単語から各単語を独立かつ一様に選択する。そのコーパスの長さは69語で、そのうち63語が異なっているため、各抽出の確率は63分の1となり、トレースには1.6%と表示される。
-
固定されたアルファベットにおいて一様抽出は最も不確実性の高い抽出であるため、log2 63は平均ではなく上限となる。6.2という目標値はその上にある。この乖離はコーパスに関する事実であり、どのようなシード、再試行、単語数であっても変更することはできない。
-
生成器が実際に表示した文章を集計する:12語が1回、13語が2回、16語が3回、10語が4回、7語が5回、2語が6回、そして1語が7回出現する。2つの合計(61の異なる単語、180個のトークン)が集計の完全性を確認し、その最初の数値がパネルの2番目の数値となる。
-
測定されたエントロピーはプラグイン推定量である。すなわち、観測された度数を確率であるかのように扱う。出現頻度ごとに単語をグループ化することで、3回出現した2つの単語の寄与が同一になるため、61項の和が7項の和に縮小される。
-
1 × log2 1 = 0 であるため、1回しか出現しなかった単語はまったく寄与せず、6つの項のみが残る。
-
差分を計算すると、表示された最後の桁までパネルの数値と一致する。
-
残りの 0.230 ビットは測定値と上限の間に存在し、これはカウントの副産物(アーティファクト)である。63語のうち2語は一度も出現せず、プラグイン推定量は不揃いなヒストグラムをあたかも真実であるかのように読み取るため、毎回エントロピーを過小評価する。ミラー・マドウ補正は、実際に観測された単語の種類の数を用いて、これを1次の範囲で補正する。
解答
語あたり 5.747 ビットであり、表示された 0.453 は無関係な2つの要素の合計である。 そのうち 0.223 は壁(限界)である。コーパスは 63 語を提供し、log2 63 = 5.9773 であり、6.2 に達するには 26.2 = 73.5、すなわち少なくとも 74 個の異なる単語の語彙が必要となる。残りの 0.230 はテキストの性質ではなくサンプルサイズに起因するものであり、補正によって回収される。真の上限 5.9773 に対して 5.988 となり、0.010 超過する。その超過の符号でさえ導出可能である。生成器は 6 個の候補文章を作成し、目標に最も近い測定値のものを保持する。すべての候補が 6.2 に達しないため、最も近いものを保持することは最も一様なものを保持することを意味する。バイアス項は 1/N として減少する。1,800 語では 0.025 ビットとなるため、より長い文章にすることで乖離の半分が自然に解消され、残りの半分はそのまま残る。
-
参考文献 (2)
- The chain the generator runs, and the entropy it reports: C. E. Shannon, "A Mathematical Theory of Communication." The Bell System Technical Journal 27(3), 379–423, 1948.
- The word-frequency shape the Zipf readout checks against: G. K. Zipf, Human Behavior and the Principle of Least Effort. Addison-Wesley, 1949.