Podcast · Episode 340
マルチエージェントRLの「シミュレータ崩壊」を克服する新手法
8月30日(日) · 5分
マルチエージェント強化学習における人間とAIのインタラクションでは、単一のLLMシミュレータが汎化失敗の原因となる「シミュレータ崩壊」を引き起こします。本研究は、この問題を理論的に解明し、推論時の「Verbalized Sampling」と訓練時の「Co-Training」という2つの画期的な解決策を提案。これにより、ポリシーの多様性を保ちつつ、実ユーザーへの転移性能を大幅に向上させました。訓練環境の多様性が汎化に不可欠であることを示唆しています。