Laboratório de entropia em PLN

Visualize as distribuições de probabilidade de tokens, a entropia de Shannon, a perplexidade, a entropia cruzada e a divergência KL — as métricas matemáticas fundamentais usadas para treinar e avaliar grandes modelos de linguagem (LLMs) de IA.

A carregar a simulação interativa...

Minimizar a entropia cruzada é o mesmo que prever o próximo token 🖖

A entropia cruzada é a função usada no treino de um modelo de linguagem, por força de uma identidade matemática. É igual à entropia dos dados mais a divergência KL dos dados relativamente ao modelo. Assim, mantendo os dados fixos, reduzir a entropia cruzada implica reduzir a divergência KL. Carregue Zipf natural: a entropia é 4,87 bits, a entropia cruzada é 6,08 e a diferença de 1,21 corresponde exatamente à divergência KL. A perplexidade exprime a mesma medida numa escala mais intuitiva: 24,87 = 29,29. A divergência KL reaparece no RLHF como penalização, mantendo o modelo alinhado próximo do modelo de partida.

O que a entropia realmente mede: surpresa 🖖

A entropia quantifica o quão imprevisível é um texto – a «surpresa» média que cada token carrega. A perplexidade traduz isso num número intuitivo: uma perplexidade de 8 significa que o modelo está, em média, tão indeciso quanto se escolhesse uniformemente entre 8 palavras. Compare um prompt repetitivo com uma prosa variada e veja a perplexidade subir: texto previsível pontua baixo, texto diverso pontua alto.

Shannon mediu o inglês com um jogo de adivinhação 🖖

Em 1951, Claude Shannon estimou a entropia do inglês não com um computador, mas com pessoas: os participantes adivinhavam a letra seguinte de um texto oculto, e a taxa de acerto limitou o inglês a cerca de 0.6 a 1.3 bits por caractere. Esse número continua sendo a régua: os LLMs modernos são avaliados pela proximidade de sua perplexidade por caractere a esse limite derivado de humanos, setenta anos depois.

Problema resolvido na íntegra

  1. De onde vêm os quatro valores de entropia no painel 5 passos

    Entropia 4,87 bits, perplexidade 29,29, entropia cruzada 6,08, divergência KL 1,21. Quatro números no painel e apenas dois deles são independentes. Encontre as duas relações exatas que os ligam.

    1. A entropia é a surpresa média da distribuição verdadeira, medida em bits: o número de perguntas de sim/não necessárias por token se codificar de forma ótima para este texto.

    2. A perplexidade apenas coloca isso numa escala mais acessível — dois elevado à entropia. Responde a 'quantas opções igualmente prováveis pareceriam tão incertas?', e 29,29 é mais fácil de visualizar do que 4,87 bits.

    3. A entropia cruzada é o custo de codificar a distribuição verdadeira usando um código construído para uma distribuição diferente. Nunca é menor do que a entropia, porque o código ótimo para P é ótimo.

    4. O excesso é a divergência KL, e é uma subtração, não um cálculo separado: 6,08388 − 4,87254 = 1,21134, até ao último dígito apresentado.

    5. Exponenciar esse excesso indica o que isso custa em termos práticos. 2^1,21 é 2,32, pelo que usar o modelo errado é como enfrentar 2,32 vezes mais escolhas por palavra — 29,29 passa a 67,8.

    Resposta

    A ferramenta exibe H = 4,87254, PP = 29,2942, H(P,Q) = 6,08388 e DKL = 1,21134. As duas identidades — a perplexidade é 2^H, e a KL é a entropia cruzada menos a entropia — são válidas para qualquer par de distribuições, pelo que são uma verificação que pode executar em qualquer relatório de modelo que receba. Explicam também por que razão os modelos de linguagem são avaliados pela entropia cruzada em vez da KL: a KL necessita da distribuição verdadeira, que ninguém possui, enquanto a entropia cruzada necessita apenas da probabilidade atribuída pelo modelo ao texto que realmente ocorreu. Minimizar uma minimiza a outra, porque a diferença é uma constante na qual o modelo não pode mexer.

Referências (3)

Problemas de exemplo

  • Saudação vulcana (uniforme) - Dezasseis tokens distribuídos por seis tipos: entropia de 2,50 bits e perplexidade de 5,66, a mais baixa desta ferramenta, embora o nome possa sugerir o contrário. O texto de comparação é idêntico, pelo que a divergência KL é exatamente 0.
  • Retórica de Trump (repetitiva) - Vinte e oito tokens distribuídos por quinze tipos dão uma entropia de 3,59 e uma perplexidade de 12,08, superiores às de Palavras uniformes. Aqui, «repetitivo» refere-se à repetição de expressões, não a um vocabulário reduzido.
  • Monólogo de Star Trek (natural) - Trinta e oito tokens distribuídos por trinta e dois tipos: entropia de 4,87 bits e perplexidade de 29,29, os valores mais elevados da ferramenta. Este é o estado usado na resolução do problema.
  • Ficção científica vs política (mudança de domínio) - Entropia de 4,01 e perplexidade de 16,13, com um texto de comparação pertencente a outro domínio. Essa diferença faz a entropia cruzada ultrapassar a entropia; o intervalo entre ambas é a divergência KL.