Aufgabe vollständig gelöst
-
Die Zielabweichungslücke von 0,453 über 180 Wörter 7 Schritte
Classic-Modus, 180 Wörter, Seed
spock, Zielentropie 6,2. Das Panel misst 5,747 Bits pro Wort und meldet eine Zielabweichung von 0,453. Bestimmen Sie, wie viel dieser Lücke der Generator überhaupt schließen könnte und wie viel davon nur existiert, weil Sie 180 Wörter statt einer Million gezählt haben.-
Der Classic-Modus wählt jedes Wort unabhängig und gleichverteilt aus den verschiedenen Wörtern des Quellkorpus aus. Dieses Korpus ist 69 Wörter lang und 63 davon sind unterschiedlich; jede Ziehung ist also eine Chance von 1 zu 63, was das Protokoll als 1,6 % ausgibt.
-
Eine Gleichverteilung ist die unvorhersehbarste Ziehung über einem festen Alphabet, daher ist log2 63 eine Obergrenze, kein Durchschnitt. Das Ziel von 6,2 liegt darüber. Dieser Teil der Abweichung ist eine Eigenschaft des Korpus, und kein Seed, kein neues Würfeln und keine Wortanzahl kann daran etwas ändern.
-
Zählen wir nun den Textabschnitt aus, den der Generator tatsächlich ausgegeben hat: 12 Wörter kommen einmal vor, 13 zweimal, 16 dreimal, 10 viermal, 7 fünfmal, 2 sechsmal und 1 Wort kommt 7-mal vor. Zwei Summen bestätigen, dass die Zählung vollständig ist – 61 verschiedene Wörter, 180 Tokens – und die erste davon ist der zweite Wert des Panels.
-
Die gemessene Entropie ist der Plug-in-Schätzer: Man nimmt die beobachteten Häufigkeiten und behandelt sie so, als wären sie die Wahrscheinlichkeiten. Das Gruppieren der Wörter nach ihrer Häufigkeit reduziert eine Summe mit 61 Termen auf eine mit 7 Termen, da zwei Wörter, die 3-mal vorkommen, identisch beitragen.
-
Die einmal vorkommenden Wörter tragen überhaupt nichts bei, da 1 × log2 1 = 0 ist, sodass nur 6 Terme übrig bleiben.
-
Subtrahiert man, entspricht das Ergebnis dem Wert auf dem Panel bis auf die letzte ausgegebene Stelle.
-
Die verbleibenden 0,230 Bits liegen zwischen der Messung und der Obergrenze, und sie sind ein Artefakt der Zählung: 2 der 63 Wörter kamen nie vor, und ein Plug-in-Schätzer liest ein ungleichmäßiges Histogramm so, als wäre es die Wahrheit, was die Entropie jedes Mal unterschätzt. Miller–Madow korrigiert dies in erster Ordnung unter Verwendung der Anzahl der tatsächlich beobachteten Worttypen.
Antwort
5,747 Bits pro Wort, und die ausgegebenen 0,453 sind zwei unzusammenhängende Dinge, die zusammenaddiert wurden. 0,223 davon bilden eine Mauer – das Korpus liefert 63 Wörter, log2 63 = 5,9773, und um 6,2 zu erreichen, benötigte man 26,2 = 73,5, also ein Vokabular von mindestens 74 verschiedenen Wörtern. Die anderen 0,230 sind keine Eigenschaft des Textes, sondern der Stichprobengröße, und die Korrektur stellt dies wieder her: 5,988 gegenüber einer tatsächlichen Obergrenze von 5,9773, was eine Überschreitung um 0,010 bedeutet. Selbst das Vorzeichen dieser Überschreitung lässt sich herleiten – der Generator erstellt 6 Kandidaten-Textabschnitte und behält denjenigen, der dem Ziel am nächsten misst, und da jeder Kandidat hinter 6,2 zurückbleibt, bedeutet das Behalten des nächsten das Behalten des gleichmäßigsten. Der Bias-Term fällt mit 1/N: Bei 1.800 Wörtern beträgt er 0,025 Bits, sodass ein längerer Textabschnitt stillschweigend die Hälfte der Abweichung behebt und die andere Hälfte genau dort belässt, wo sie war.
-
Quellen (2)
- The chain the generator runs, and the entropy it reports: C. E. Shannon, "A Mathematical Theory of Communication." The Bell System Technical Journal 27(3), 379–423, 1948.
- The word-frequency shape the Zipf readout checks against: G. K. Zipf, Human Behavior and the Principle of Least Effort. Addison-Wesley, 1949.