Podcast · Episode 325
LLMの推論能力向上技術OPDは「見せかけの蒸留」か?効率改善が本質との研究結果
8月28日(金) · 6分
大規模言語モデル(LLM)の推論能力を向上させるオンポリシー蒸留(OPD)は、教師モデルからの知識蒸留による能力拡張と一般に信じられてきました。しかし、最新の研究では、OPDが主にサンプリング効率を改善するものであり、モデルの推論能力の境界を一貫して拡張するものではない可能性が指摘されています。この発見は、OPDの活用方法に新たな視点をもたらします。