Podcast · Episode 192
WDL-OPD:不安定なAI学習を安定化させる新手法、混合制約型共同学習で性能向上
8月17日(月) · 5分
強化学習におけるオンポリシー蒸留(OPD)は、学生モデルが自身の生成した軌跡に基づいて教師モデルに合わせることで、オフライン蒸留の課題を克服します。しかし、このフィードバックループは不安定になりがちです。今回発表されたWDL-OPDは、二つの学習可能なポリシーを用いた混合制約型共同学習により、この不安定性を解消。Qwen3モデルでの実験では、数学問題とコード生成の両方で顕著な精度向上を達成し、AIモデルの安定した高性能化に貢献します。