Temperatura y muestreo

Todo lo que hace un modelo entre puntuar el vocabulario y elegir una palabra es aritmética sin nada de azar. Los dados se lanzan una sola vez, al final.

Cargando simulación interactiva...

La temperatura no es azar 🖖

Todos los pasos de esta página menos el último son aritmética con una respuesta fija. La temperatura divide las puntuaciones antes de la exponencial, top-k conserva un número fijo, top-p conserva una fracción fija: ejecuta cualquiera de ellos dos veces con los mismos ajustes y obtendrás números idénticos. El azar entra exactamente una vez, cuando «Sacar un token» lanza un único número contra estas probabilidades. Por eso «baja la temperatura para hacerlo determinista» es una descripción equivocada: una temperatura baja hace que un resultado sea abrumadoramente probable, y eso no es lo mismo que seguro.

Top-k y top-p fijan cosas distintas 🖖

Top-k conserva un número fijo de candidatos y deja flotar la probabilidad capturada: k = 3 conserva tres siempre, pero esos tres suman el 40,7% tras ␣a y el 72,2% tras ␣so. Top-p hace lo contrario: fija la fracción y deja flotar el número, de modo que p = 50% conserva cinco candidatos tras ␣a y solo uno tras ␣it. Por eso suele preferirse el muestreo por núcleo: cuántas opciones debería considerar un modelo depende de lo seguro que esté, y solo uno de estos dos ajustes puede darse cuenta de eso.

Un token de contexto, y doce candidatos de 1280 🖖

Esta página ejecuta un bigrama: mira exactamente un token hacia atrás y nada más. Un transformer mira miles, y esa es toda la diferencia entre esto y algo capaz de escribir. Lo que sobrevive a la comparación es la aritmética —las puntuaciones se vuelven probabilidades, la temperatura las reforma, el recorte las corta, se saca una— y la forma del problema. Tras ␣the este corpus ofrece 1280 continuaciones distintas, y las doce mostradas aquí cubren el 13,6% de sus apariciones. La cola es la mayor parte de la distribución, y el recorte es lo que impide que se filtre a la salida.

Problema resuelto al detalle

  1. Doce continuaciones candidatas que cubren el 13,6% de lo que realmente sigue 5 pasos

    Doce continuaciones candidatas cubren el 13,6% de lo que realmente sigue a este contexto. Averigüe qué aspecto tiene el 86% restante y por qué esa distribución determina cómo debe operar el muestreo.

    1. El corpus ofrece 1280 continuaciones distintas para este contexto. Esa es la distribución real que el modelo intenta imitar, y resulta mucho más amplia que cualquier lista reducida.

    2. Las doce principales —las que puntúa el panel— representan entre todas el 13,6% de las apariciones.

    3. De este modo, las 1268 continuaciones restantes se reparten el 86,4%. Ninguna de ellas es probable de forma aislada, pero en conjunto representan la mayor parte de lo que ocurre.

    4. Eso significa que el 99,1% de las opciones concentra el 86,4% de la probabilidad: una cola larga, no un pico con ruido alrededor.

    5. Con top-k desactivado, se conservan las doce opciones y el panel indica que se mantiene el 100 % de la probabilidad. Ese 100 % se calcula dentro de la lista de preselección, mientras que el 13,6 % se mide respecto al corpus. Por eso, todos los filtros de esta página recortan la cabeza de la distribución: las 1.268 continuaciones de la cola ya habían desaparecido antes de que movieras ningún control.

    Respuesta

    La herramienta muestra 12 / 12 opciones conservadas, 100,0 % de probabilidad retenida, 1.280 continuaciones distintas y una cobertura del 13,6 %. La dificultad del muestreo está en la cola. Si eliges siempre el token más probable, el texto acaba repitiéndose, pues te limitas una y otra vez al 13,6 %. Si muestreas entre todas las opciones, tarde o temprano aparecerá algo absurdo: el 86,4 % de la masa de probabilidad corresponde a opciones que, por separado, son pésimas. Top-k y top-p permiten recortar la cola sin aplanar la cabeza; las cifras anteriores reflejan el equilibrio que buscan. Fíjate en el efecto de la temperatura: ajusta top-p a 90 y se conservarán diez de las doce opciones. Después, sube la temperatura a 1,50 y regresará una undécima, porque al aplanar la distribución el núcleo se ensancha.

Ruta de aprendizaje

Cómo elige un LLM la siguiente palabra

Referencias (2)

Problemas de ejemplo

  • Contexto menos seguro - Tras ␣a el corpus ofrece 980 continuaciones distintas, y el líder ␣single se lleva solo el 24,6% de las doce mostradas. Esas doce cubren el 12,5% de todo lo que alguna vez le siguió.
  • Contexto más seguro - Tras ␣so el líder ␣the se lleva el 43,2%, y las doce mostradas cubren el 53,9% de todas las apariciones: este contexto se ha decidido, y ␣a no.
  • Frío: temperatura 0,2 - A temperatura 0,2 el líder ␣same tiene el 99,5% y aventaja al segundo en 278×. No se eliminó nada; solo se estiraron las diferencias.
  • Caliente: temperatura 2 - A temperatura 2 el mismo líder ␣same tiene el 18,2%, y su ventaja sobre el segundo ha bajado a 1,76×. Sigue siendo el líder: eso no cambió nunca.
  • Núcleo: conservar el 50% - Conservar el 50% de la probabilidad deja 3 candidatos de 12, que suman el 54,5%. Renormalizar le da al líder el 63,6%.
  • Temperatura 0 - La temperatura 0 conserva 1 candidato de 12. No es un softmax muy frío; es argmax, y el panel lo dice.