Podcast · Episode 225
LLMの「心の理論」評価新時代:非対称ゲーム「アバロン」で深掘り
8月19日(水) · 4分
AIエージェントの「心の理論(ToM)」評価は、これまで静的なシナリオに依存し、診断的洞察が不足していました。今回、非対称情報ゲーム「The Resistance: Avalon」を基盤とした新ベンチマーク「Avalon-ToM-Bench」が登場。LLMがゲームルールを理解してもToM能力が低いこと、隠れた状態では正しい推論を表象するが表現できないこと、そしてToMには熟慮よりも学習された推論ポリシーが重要であることを明らかにしました。