Laboratório de entropia em PLN
Visualize as distribuições de probabilidade de tokens, a entropia de Shannon, a perplexidade, a entropia cruzada e a divergência KL — as métricas matemáticas fundamentais usadas para treinar e avaliar grandes modelos de linguagem (LLMs) de IA.
Matemática profunda da teoria da informação e dos LLMs de IA 🖖
A entropia de Shannon, a entropia cruzada, a perplexidade e a divergência KL são as métricas matemáticas fundamentais usadas para treinar e avaliar grandes modelos de linguagem (LLMs) de IA como GPT-4 e Llama. Minimizar a entropia cruzada equivale a treinar o modelo para prever o próximo token, enquanto a perplexidade mede seu desempenho de avaliação, e a divergência KL é usada como penalidade no alinhamento por aprendizado por reforço RLHF.
O que a entropia realmente mede: surpresa 🖖
A entropia quantifica o quão imprevisível é um texto – a «surpresa» média que cada token carrega. A perplexidade traduz isso num número intuitivo: uma perplexidade de 8 significa que o modelo está, em média, tão indeciso quanto se escolhesse uniformemente entre 8 palavras. Compare um prompt repetitivo com uma prosa variada e veja a perplexidade subir: texto previsível pontua baixo, texto diverso pontua alto.
Shannon mediu o inglês com um jogo de adivinhação 🖖
Em 1951, Claude Shannon estimou a entropia do inglês não com um computador, mas com pessoas: os participantes adivinhavam a letra seguinte de um texto oculto, e a taxa de acerto limitou o inglês a cerca de 0.6 a 1.3 bits por caractere. Esse número continua sendo a régua: os LLMs modernos são avaliados pela proximidade de sua perplexidade por caractere a esse limite derivado de humanos, setenta anos depois.
Problemas de exemplo
- Saudação vulcana (uniforme) - Frequências uniformes de tokens produzem entropia maior do que prompts repetitivos.
- Retórica de Trump (repetitiva) - A repetição reduz a incerteza dos tokens e diminui a perplexidade.
- Monólogo de Star Trek (natural) - Textos naturais tendem a apresentar uma distribuição de frequência por rank do tipo Zipf.
- Ficção científica vs política (mudança de domínio) - A incompatibilidade de domínio aumenta a entropia cruzada e a divergência KL.