Problema resuelto al detalle
-
Doce continuaciones candidatas que cubren el 13,6% de lo que realmente sigue 5 pasos
Doce continuaciones candidatas cubren el 13,6% de lo que realmente sigue a este contexto. Averigüe qué aspecto tiene el 86% restante y por qué esa distribución determina cómo debe operar el muestreo.
-
El corpus ofrece 1280 continuaciones distintas para este contexto. Esa es la distribución real que el modelo intenta imitar, y resulta mucho más amplia que cualquier lista reducida.
-
Las doce principales —las que puntúa el panel— representan entre todas el 13,6% de las apariciones.
-
De este modo, las 1268 continuaciones restantes se reparten el 86,4%. Ninguna de ellas es probable de forma aislada, pero en conjunto representan la mayor parte de lo que ocurre.
-
Eso significa que el 99,1% de las opciones concentra el 86,4% de la probabilidad: una cola larga, no un pico con ruido alrededor.
-
Con top-k desactivado, se conservan las doce opciones y el panel indica que se mantiene el 100 % de la probabilidad. Ese 100 % se calcula dentro de la lista de preselección, mientras que el 13,6 % se mide respecto al corpus. Por eso, todos los filtros de esta página recortan la cabeza de la distribución: las 1.268 continuaciones de la cola ya habían desaparecido antes de que movieras ningún control.
Respuesta
La herramienta muestra 12 / 12 opciones conservadas, 100,0 % de probabilidad retenida, 1.280 continuaciones distintas y una cobertura del 13,6 %. La dificultad del muestreo está en la cola. Si eliges siempre el token más probable, el texto acaba repitiéndose, pues te limitas una y otra vez al 13,6 %. Si muestreas entre todas las opciones, tarde o temprano aparecerá algo absurdo: el 86,4 % de la masa de probabilidad corresponde a opciones que, por separado, son pésimas. Top-k y top-p permiten recortar la cola sin aplanar la cabeza; las cifras anteriores reflejan el equilibrio que buscan. Fíjate en el efecto de la temperatura: ajusta top-p a 90 y se conservarán diez de las doce opciones. Después, sube la temperatura a 1,50 y regresará una undécima, porque al aplanar la distribución el núcleo se ensancha.
-
Ruta de aprendizaje
Cómo elige un LLM la siguiente palabra
Referencias (2)
- Where the temperature in a softmax comes from — it is the one in the Boltzmann distribution: D. H. Ackley, G. E. Hinton and T. J. Sejnowski, "A Learning Algorithm for Boltzmann Machines." Cognitive Science 9(1), 147–169, 1985.
- Why lowering the temperature is not the same as improving the text, and what nucleus sampling does instead: A. Holtzman, J. Buys, L. Du, M. Forbes and Y. Choi, "The Curious Case of Neural Text Degeneration." ICLR 2020.