Podcast · Episode 347
安全オフライン強化学習を革新:RCIフレームワークで疎なフィードバックからコストを推定
8月30日(日) · 4分
安全オフライン強化学習では通常、詳細なステップごとのコスト情報が必要ですが、実世界では「危険」という軌道レベルの疎なフィードバックしか得られない課題があります。この問題を解決するため、RCI(Redistribution-based Cost Inference)フレームワークが提案されました。RCIは、疎な停止フィードバックをリターン分解により密なステップごとのコストに変換し、安全なポリシー学習を可能にします。理論的な保証と実践的な効果が示されています。