0 / 4 節読了

LLMの自律学習における課題

大規模言語モデル(LLM)は、最適化問題の解決能力を高めるため、経験から学習する仕組みを持っています。この仕組みは、検証済みの能力を蓄積することで改善します。

しかし、既存の学習方法には大きな課題がありました。それは、学習する知識を既知の正解と照らし合わせて取り込むことです。実際の業務データには、常に明確な正解があるわけではありません。そのため、正解がない状況で知識を取り込むと、誤った情報が混ざってしまう危険性があります。

例えば、実行可能なプログラムを全て取り込むと、約4分の1が誤った知識になることが分かりました。また、一部だけ一致するプログラムを受け入れる方法も、全体では異なる結果を出すため信頼できません。このような問題が、LLMの自律学習の信頼性を下げていました。

新しい承認システム「AdmitOR」の仕組み

この課題を解決するため、新しい承認システム「AdmitOR」が提案されました。AdmitORは、正解がない状況でも正確な知識を取り込むための関門です。このシステムは、外部の行動証拠に基づいて判断基準を校正します。

具体的には、3つの異なるプログラムの系統、プロンプトの戦略、解決策のスタックから候補を選びます。これらを、抽出されたパラメータ領域から再サンプリングした具体例で実行します。その結果として得られる価値関数の軌跡の一致度を、異なる系統間のクリークという手法でまとめます。そして、校正されたしきい値を使って、「承認」「保留」「エスカレート」のいずれかを判断します。

精度向上と誤った知識の削減

AdmitORは、LLMの知識取り込み精度を大きく向上させました。最先端のスキル学習器で複数の承認判断方法を比較したところ、AdmitORは承認精度を0.927まで高めました。これは、多数決方式の0.871や、実行成功のみで判断する0.726を大きく上回ります。

この結果、AdmitORは多数決方式に比べて3.1倍、実行成功方式に比べて8.0倍も、誤った知識の取り込みを減らすことができました。AdmitORが構築する知識の集まりは最も小さく、5つの公開ベンチマークで最高のマクロ精度58.4を達成しています。多数決方式の54.8や、正解ラベル付きの知識の集まりの53.9よりも高い精度です。

実際のデータでの課題と今後の展望

AdmitORは、校正データ上では高い精度を示しました。しかし、実際のデータストリームでは、事前登録された偽発見基準が期待通りに機能しないことが判明しました。この失敗の主な原因は、ベンチマークのテキストが、正解ラベル付きの具体例を正確に表現していなかったためです。

この結果は、AdmitORを実際のデータに適用する上で重要な条件を明らかにしました。テキストデータが現実の状況を忠実に反映していることが、この仕組みを広く活用するための鍵となります。AdmitORは、明示的に校正された偽発見目標に基づいて設計された、初の正解なし承認メカニズムです。この研究は、LLMの自律学習の信頼性を高めるための重要な一歩となるでしょう。

柴亮太
柴亮太の視点

LLMの自律学習は、何を「正しい」と判断するかが全てです。正解がない状況で正しく学ぶ仕組みは、まさに一次情報を取りに行く私のやり方と同じ。この考え方を自分のAIプロダクトにも応用します。