Laboratório de entropia em PLN

Visualize as distribuições de probabilidade de tokens, a entropia de Shannon, a perplexidade, a entropia cruzada e a divergência KL — as métricas matemáticas fundamentais usadas para treinar e avaliar grandes modelos de linguagem (LLMs) de IA.

A carregar a simulação interativa...

Matemática profunda da teoria da informação e dos LLMs de IA 🖖

A entropia de Shannon, a entropia cruzada, a perplexidade e a divergência KL são as métricas matemáticas fundamentais usadas para treinar e avaliar grandes modelos de linguagem (LLMs) de IA como GPT-4 e Llama. Minimizar a entropia cruzada equivale a treinar o modelo para prever o próximo token, enquanto a perplexidade mede seu desempenho de avaliação, e a divergência KL é usada como penalidade no alinhamento por aprendizado por reforço RLHF.

O que a entropia realmente mede: surpresa 🖖

A entropia quantifica o quão imprevisível é um texto – a «surpresa» média que cada token carrega. A perplexidade traduz isso num número intuitivo: uma perplexidade de 8 significa que o modelo está, em média, tão indeciso quanto se escolhesse uniformemente entre 8 palavras. Compare um prompt repetitivo com uma prosa variada e veja a perplexidade subir: texto previsível pontua baixo, texto diverso pontua alto.

Shannon mediu o inglês com um jogo de adivinhação 🖖

Em 1951, Claude Shannon estimou a entropia do inglês não com um computador, mas com pessoas: os participantes adivinhavam a letra seguinte de um texto oculto, e a taxa de acerto limitou o inglês a cerca de 0.6 a 1.3 bits por caractere. Esse número continua sendo a régua: os LLMs modernos são avaliados pela proximidade de sua perplexidade por caractere a esse limite derivado de humanos, setenta anos depois.

Problemas de exemplo