Problema resuelto al detalle
-
La diferencia de desajuste objetivo de 0,453 sobre 180 palabras 7 pasos
Modo clásico, 180 palabras, semilla
spock, entropía objetivo 6,2. El panel mide 5,747 bits por palabra e informa de un desajuste respecto al objetivo de 0,453. Determine qué parte de esa diferencia podría llegar a cerrar el generador y qué parte existe únicamente por haber contado 180 palabras en lugar de un millón.-
El modo clásico elige cada palabra de forma independiente y uniforme a partir de las palabras distintas del corpus de origen. Dicho corpus consta de 69 palabras y 63 de ellas son diferentes, por lo que cada elección tiene una probabilidad de 1 entre 63, lo que la traza muestra como 1,6%.
-
Una elección uniforme es la más impredecible que existe sobre un alfabeto fijo, de modo que log2 63 representa un límite superior, no un promedio. El objetivo de 6,2 se sitúa por encima de dicho límite. Esa parte del desajuste es una propiedad del corpus y ninguna semilla, ningún nuevo intento ni ninguna cantidad de palabras pueden cambiarla.
-
A continuación, recuente el texto que el generador ha mostrado realmente: 12 palabras aparecen una vez, 13 dos veces, 16 tres veces, 10 cuatro veces, 7 cinco veces, 2 seis veces y 1 palabra aparece 7 veces. Dos sumas confirman que el recuento es completo (61 palabras distintas, 180 tokens) y la primera de ellas es la segunda cifra del panel.
-
La entropía medida es la estimación por sustitución: se toman las frecuencias observadas y se tratan como si fueran las probabilidades. Al agrupar las palabras según su frecuencia de aparición, una suma de 61 términos se reduce a una de 7 términos, ya que dos palabras observadas 3 veces aportan exactamente lo mismo.
-
Las palabras observadas una sola vez no aportan nada, dado que 1 × log2 1 = 0, de modo que solo se conservan 6 términos.
-
Reste, y el resultado coincide exactamente con el panel hasta la última cifra mostrada.
-
Los 0,230 bits restantes se sitúan entre la medida y el límite superior, y son un artefacto del recuento: 2 de las 63 palabras nunca aparecieron, y una estimación por sustitución interpreta un histograma irregular como si fuera la realidad, lo que infravalora la entropía en todos los casos. La corrección de Miller–Madow corrige esto a primer orden utilizando el número de tipos de palabras observados realmente.
Respuesta
5,747 bits por palabra, y el valor impreso de 0,453 es la suma de dos factores independientes. 0,223 corresponden a un límite insalvable: el corpus proporciona 63 palabras, log2 63 = 5,9773, y para alcanzar 6,2 se necesitarían 26,2 = 73,5, es decir, un vocabulario de al menos 74 palabras distintas. Los otros 0,230 no son una propiedad del texto sino del tamaño de la muestra, y la corrección los recupera: 5,988 frente a un límite superior real de 5,9773, lo que supone una sobreestimación de 0,010. Incluso el signo de dicha sobreestimación es deducible: el generador crea 6 textos candidatos y conserva el que más se aproxima al objetivo; como todos los candidatos se quedan por debajo de 6,2, conservar el más cercano equivale a conservar el más uniforme. El término de sesgo decrece como 1/N: a 1.800 palabras es de 0,025 bits, por lo que un texto más largo resuelve silenciosamente la mitad del desajuste y deja la otra mitad exactamente donde estaba.
-
Referencias (2)
- The chain the generator runs, and the entropy it reports: C. E. Shannon, "A Mathematical Theory of Communication." The Bell System Technical Journal 27(3), 379–423, 1948.
- The word-frequency shape the Zipf readout checks against: G. K. Zipf, Human Behavior and the Principle of Least Effort. Addison-Wesley, 1949.