柴亮太の
AI最前線
最新
基礎
タイムライン
ポッドキャスト
About
☰
×
最新
基礎
タイムライン
ポッドキャスト
About
← ポッドキャスト一覧に戻る
Podcast · Episode 240
RRC:ランキングでLLM強化学習の生成型報酬モデルを解き放つ
8月20日(木) · 5分
LLMの強化学習において、生成型報酬モデルの潜在能力を最大限に引き出す新手法「RRC」が発表されました。既存のRLアルゴリズムがスカラー値を用いるのに対し、生成型報酬モデルは比較的な性質を持つため、両者のミスマッチが課題でした。RRCはこのギャップを埋め、相対的な選好順位から報酬を導き出すことで、強化学習の効率を大幅に向上させます。
元記事を読む →
前のエピソード
AGI達成の鍵はビデオゲームデータか?LLMの限界を超える新視点
次のエピソード
「MetaboLLM」登場:代謝物グラフで病態予測、医療AIの新境地を開拓