← ポッドキャスト一覧に戻る
Podcast · Episode 225

LLMの「心の理論」評価新時代:非対称ゲーム「アバロン」で深掘り

8月19日(水) · 4分
AIエージェントの「心の理論(ToM)」評価は、これまで静的なシナリオに依存し、診断的洞察が不足していました。今回、非対称情報ゲーム「The Resistance: Avalon」を基盤とした新ベンチマーク「Avalon-ToM-Bench」が登場。LLMがゲームルールを理解してもToM能力が低いこと、隠れた状態では正しい推論を表象するが表現できないこと、そしてToMには熟慮よりも学習された推論ポリシーが重要であることを明らかにしました。
前のエピソードゼロ値が多い時系列データにおける生成モデル評価の落とし穴 次のエピソード動画生成の品質と多様性を両立:DUETモデルが2ステップ生成の課題を克服