世界の挙動を模倣する仕組みの課題
大規模言語モデル(LLM)は、実行可能な「世界の挙動を模倣する仕組み」を生成します。これは、古典的な計画策定器が探索する対象です。この仕組みは、抽出された状態変化を再現できれば承認されます。しかし、この承認が連続的な制御において何を保証するのか、という疑問が投げかけられています。
本研究では、この一連の流れに潜む危険性を「期待される危険度」として定義しました。そして、その危険度の正確な要因を特定しています。確率rの重要な出来事をN回の独立同分布(i.i.d.:それぞれの試行が互いに影響せず、同じ確率分布に従うこと)なゲートの試行がすべて見逃す確率は、厳密に(1-r)^Nとなることが分かりました。さらに、独立した承認のための抽出が、この指数の値を大きくします。
試行による検証の限界
三つの複合的な装置を使った実験を行いました。その結果、モードを考慮しない承認された仕組みは、重大な問題を引き起こすことが判明しました。計画策定器はモードの境界で固定され、得られるはずだった成果のほぼ全てを失う損失が発生しました。これは、試行による検証だけでは、仕組みの持つ全ての挙動を捉えきれないことを示しています。
不連続なリセット状態は、このような予算を必要としません。しかし、リプシッツ定数(関数の変化の速さを示す値)Lを持つ仕組みが、ある点でイータだけ異なる場合、許容範囲イプシロンを超える不一致が、体積カッパ((イータ-イプシロン)/L)^(d+m)の領域で発生します。これは、わずかな違いが大きな影響を及ぼす可能性を示唆しています。
大規模言語モデルの能力と盲点
実際の大規模言語モデルによる生成、具体的にはGPT-5.xを用いた実験も行いました。GPT-5.xは、111回のモードを含む描画のうち105回で、省略された1次元の制約(クランプ)を修正しました。これは、56の装置の流れのブロックのうち50で正確な修正を達成しています(95%信頼区間は0.781から0.960)。
しかし、2次元の領域では、この仕組みは規則を回復できませんでした(156回中0回)。八つの狙いを定めた介入を行っても、この失敗は解消されませんでした。ポジティブコントロール(実験の妥当性を確認するための対照群)によって問題の場所は特定されましたが、規則自体は導き出されませんでした。形と場所が与えられれば、定数は正確に導かれます。
私の見方と今後の対策
バージョン空間の証明により、識別がクラス相対的であることが証明されました。最も広い範囲で宣言された適合は、20ブロック中20ブロックで成功し、全ての試行と一貫する円が20中18で許容範囲内でした。しかし、全ての試行と厳密に一貫するにもかかわらず、実行時には無害な入力規則のクラスが存在することも証明されました。このため、識別可能性は装置の測定可能な特性と言えます。
私は、この研究がAIプロダクト開発の現場に重要な示唆を与えていると感じます。1034個の生成物を独立した抽出で再評価した結果、承認は試行との一貫性しか保証しないことが確認されました。情報量のあるゲートであっても、利用される計画策定器の問い合わせの約2パーセントしかカバーしないのです。これは、見かけ上の成功に惑わされず、より深い検証が必要であることを示しています。
PR
文賢 →
AIが生成するコードの検証は、見かけ上の一致だけでは不十分です。想定外の挙動をいかに見つけるか。これは一次情報をぐるぐる回し、設計を磨くしかありません。机上の空論ではプロダクトは作れません。