← ポッドキャスト一覧に戻る
Podcast · Episode 302

公開トークナイザー語彙からLLMの隠れた学習データを高精度推定

8月26日(水) · 3分
LLMの性能を左右する事前学習コーパスの構成は、モデルが公開されても不明な場合が多いです。本研究は、公開されたトークナイザーの語彙情報から、隠されたコーパスの構成比率をトークンレベルで高精度に推定する新手法「QGDE」を提案しました。これにより、LLMがどのようなデータで学習されたかをより詳細に把握できるようになります。平均相対誤差は3%台と非常に高い精度を実現しています。
前のエピソード安価に最適化、強力に展開:LLMプロンプト進化最適化の新戦略 次のエピソード企業QAの真価を問う:潜在的組織的推論ベンチマーク『ENTLORE』公開