NLPエントロピー・ラボ
トークンの確率分布、シャノンエントロピー、パープレキシティ、交差エントロピー、KLダイバージェンスを可視化する — AIの大規模言語モデル(LLM)の学習と評価に使われる基本的な数学的指標。
インタラクティブシミュレーションを読み込んでいます...
情報理論とAI大規模言語モデルの深い数学 🖖
シャノンエントロピー、交差エントロピー、パープレキシティ、KLダイバージェンスは、GPT-4やLlamaのようなAIの大規模言語モデル(LLM)の学習と評価に使われる基礎的な数学的指標である。交差エントロピーを最小化することは、次のトークンを予測するようにモデルを学習させることと等価であり、パープレキシティはその評価性能を測り、KLダイバージェンスはRLHFの強化学習によるアライメントでペナルティ項として使われる。
エントロピーが測るのは「驚き」 🖖
エントロピーはテキストがどれだけ予測しにくいか、つまり各トークンが持つ平均的な「驚き」を表します。パープレキシティはそれを直感的な数値に変換し、値が8なら、モデルは平均して8語から一様に選ぶのと同じくらい迷っていることを意味します。繰り返しの多いプロンプトと多彩な文章を比べると、予測しやすい文章は低く、多様な文章は高くパープレキシティが上がる様子がわかります。
シャノンは英語を当てゲームで測った 🖖
1951年、クロード・シャノンは英語のエントロピーをコンピュータではなく人間を使って推定しました。被験者に隠された文章の次の文字を当てさせ、その的中率から英語を1文字あたり約0.6〜1.3ビットと絞り込んだのです。この数値は今なお基準であり、現代のLLMは文字あたりのパープレキシティがこの人間由来の限界にどれだけ近づけるかで、70年経った今も評価されています。
例題
- バルカン式の挨拶(一様分布) - トークンの出現頻度が均一だと、反復的なプロンプトよりもエントロピーが高くなる。
- トランプ節(反復的) - 反復はトークンの不確実性を減少させ、パープレキシティを低下させる。
- スタートレックの独白(自然) - 自然な文章は、ジップの法則のような順位・頻度分布を示す傾向がある。
- SF vs 政治(ドメインシフト) - ドメインの不一致は交差エントロピーとKLダイバージェンスを増大させる。