Laboratorio Generador de Lorem Ipsum

Explora la generación determinista de lorem, métricas de teoría de la información (entropía/temperatura) y cómo los bucles de contexto de Markov son los antecesores directos de los modernos Modelos de Lenguaje de Gran Escala (LLM).

Cargando simulación interactiva...

Tu control de entropía es un mando de temperatura de un LLM 🖖

Una cadena de Markov es el antecesor matemático directo de los modernos Modelos de Lenguaje de Gran Escala (LLM). Ambos funcionan bajo el mismo bucle autorregresivo de predicción del siguiente token. El generador observa las N palabras anteriores (ventana de contexto) y elige la siguiente palabra a partir de una distribución de probabilidad. Mientras que una cadena de Markov simplemente busca frases exactas en un corpus pequeño, un LLM usa miles de millones de parámetros (capas de atención) para evaluar el contexto y calcular probabilidades. Además, ajustar aquí la entropía objetivo corresponde directamente al parámetro Temperatura de las API de LLM: una entropía más alta crea texto creativo y diverso (temperatura alta), mientras que una entropía más baja crea texto repetitivo y predecible (temperatura baja).

Por qué el texto sin sentido mejora los bocetos 🖖

El texto de relleno existe para que puedas juzgar un diseño — espaciado, tamaño de fuente, saltos de línea — sin distraerte con lo que las palabras dicen realmente. El texto real tienta a los revisores a reescribir frases antes de que el diseño esté siquiera definido. Este laboratorio va un paso más allá: las métricas de entropía y de Zipf permiten comprobar si tu relleno imita la frecuencia de palabras del lenguaje real, de modo que los párrafos se ajusten como lo hará el contenido definitivo.

Lorem ipsum es Cicerón mutilado 🖖

«Lorem ipsum» no es una jerigonza inventada: es latín desordenado tomado del tratado de ética de Cicerón De finibus bonorum et malorum, escrito en el 45 a. C. Incluso empieza a media palabra: Lorem es la cola de dolorem («dolor»), a la que se le cortó la primera sílaba. Así, el relleno por defecto de la web es una reflexión de hace 2.000 años sobre el placer y el dolor, mutilada por los primeros impresores en un muestrario tipográfico — y el modo Markov te deja volver a barajar lo que ellos barajaron a mano.

Problema resuelto al detalle

  1. La diferencia de desajuste objetivo de 0,453 sobre 180 palabras 7 pasos

    Modo clásico, 180 palabras, semilla spock, entropía objetivo 6,2. El panel mide 5,747 bits por palabra e informa de un desajuste respecto al objetivo de 0,453. Determine qué parte de esa diferencia podría llegar a cerrar el generador y qué parte existe únicamente por haber contado 180 palabras en lugar de un millón.

    1. El modo clásico elige cada palabra de forma independiente y uniforme a partir de las palabras distintas del corpus de origen. Dicho corpus consta de 69 palabras y 63 de ellas son diferentes, por lo que cada elección tiene una probabilidad de 1 entre 63, lo que la traza muestra como 1,6%.

    2. Una elección uniforme es la más impredecible que existe sobre un alfabeto fijo, de modo que log2 63 representa un límite superior, no un promedio. El objetivo de 6,2 se sitúa por encima de dicho límite. Esa parte del desajuste es una propiedad del corpus y ninguna semilla, ningún nuevo intento ni ninguna cantidad de palabras pueden cambiarla.

    3. A continuación, recuente el texto que el generador ha mostrado realmente: 12 palabras aparecen una vez, 13 dos veces, 16 tres veces, 10 cuatro veces, 7 cinco veces, 2 seis veces y 1 palabra aparece 7 veces. Dos sumas confirman que el recuento es completo (61 palabras distintas, 180 tokens) y la primera de ellas es la segunda cifra del panel.

    4. La entropía medida es la estimación por sustitución: se toman las frecuencias observadas y se tratan como si fueran las probabilidades. Al agrupar las palabras según su frecuencia de aparición, una suma de 61 términos se reduce a una de 7 términos, ya que dos palabras observadas 3 veces aportan exactamente lo mismo.

    5. Las palabras observadas una sola vez no aportan nada, dado que 1 × log2 1 = 0, de modo que solo se conservan 6 términos.

    6. Reste, y el resultado coincide exactamente con el panel hasta la última cifra mostrada.

    7. Los 0,230 bits restantes se sitúan entre la medida y el límite superior, y son un artefacto del recuento: 2 de las 63 palabras nunca aparecieron, y una estimación por sustitución interpreta un histograma irregular como si fuera la realidad, lo que infravalora la entropía en todos los casos. La corrección de Miller–Madow corrige esto a primer orden utilizando el número de tipos de palabras observados realmente.

    Respuesta

    5,747 bits por palabra, y el valor impreso de 0,453 es la suma de dos factores independientes. 0,223 corresponden a un límite insalvable: el corpus proporciona 63 palabras, log2 63 = 5,9773, y para alcanzar 6,2 se necesitarían 26,2 = 73,5, es decir, un vocabulario de al menos 74 palabras distintas. Los otros 0,230 no son una propiedad del texto sino del tamaño de la muestra, y la corrección los recupera: 5,988 frente a un límite superior real de 5,9773, lo que supone una sobreestimación de 0,010. Incluso el signo de dicha sobreestimación es deducible: el generador crea 6 textos candidatos y conserva el que más se aproxima al objetivo; como todos los candidatos se quedan por debajo de 6,2, conservar el más cercano equivale a conservar el más uniforme. El término de sesgo decrece como 1/N: a 1.800 palabras es de 0,025 bits, por lo que un texto más largo resuelve silenciosamente la mitad del desajuste y deja la otra mitad exactamente donde estaba.

Referencias (2)

Problemas de ejemplo

  • equilibrado - Texto de relleno equilibrado con entropía moderada y semilla reproducible.
  • similar a Zipf - Perfil de rango-frecuencia tipo Zipf para simular la caída de frecuencia del lenguaje natural.
  • cadena de Markov - Texto en modo Markov con memoria local de secuencia y mayor variabilidad.