← ポッドキャスト一覧に戻る
Podcast · Episode 340

マルチエージェントRLの「シミュレータ崩壊」を克服する新手法

8月30日(日) · 5分
マルチエージェント強化学習における人間とAIのインタラクションでは、単一のLLMシミュレータが汎化失敗の原因となる「シミュレータ崩壊」を引き起こします。本研究は、この問題を理論的に解明し、推論時の「Verbalized Sampling」と訓練時の「Co-Training」という2つの画期的な解決策を提案。これにより、ポリシーの多様性を保ちつつ、実ユーザーへの転移性能を大幅に向上させました。訓練環境の多様性が汎化に不可欠であることを示唆しています。
前のエピソードSuno、BMGと世界規模で提携合意|訴訟なしで過去利用も清算 次のエピソード企業ガイドライン文書のAI活用を革新する「GUIDE」:ガバナンスと自動生成