自己進化型エージェントの従来の課題
自己進化型エージェントは、通常、事前に定められた最適化パイプラインに基づいて構築されてきました。これは、証拠の収集方法、永続的な成果物の改訂、候補の選択、そして停止条件まで、フレームワークが細かく決定する手法です。このアプローチは、タスク固有の手順として機能し、エージェントの改善プロセスを管理する上で一定の役割を果たしてきました。しかし、私はこのやり方に疑問を感じていました。本当に、ここまで細かく指示する必要があるのでしょうか。最先端のフロンティアモデルが最適化を担う時代において、この「処方された」手順が必須なのか、という問いが浮上します。
新たな最適化手法「OEO」の登場
この問いに対し、私は「Open-Ended Optimization (OEO)」という新しいアプローチに注目しています。OEOは、目的、許容される相互作用、リソース予算、データ境界、評価基準は固定するものの、最適化プロセス自体は最適化モデルがオンラインで構成することを許可します。つまり、何を目指すかは人間が決めますが、そこに至るまでの「やり方」はモデルに任せるという考え方です。これは、モデルの能力を最大限に引き出し、より柔軟で効率的な最適化を実現する可能性を秘めていると私は感じます。
OEOが示す圧倒的な性能
OEOの有効性を検証するため、私はOEOを、既存の2つの処方されたアプローチである「SkillOpt」(段階的なパイプライン)と「GEPA」(反射的な進化的探索)と比較しました。結果は明確です。GPT-5.5が駆動するOEOは、8つのベンチマーク・ターゲットモデル設定における14回の直接比較で、12勝1引き分け1敗という圧倒的な成績を記録しました。唯一の敗北もわずか0.21パーセンテージポイントの僅差です。さらに、OEOはSkillOptの構成されたターゲット相互作用トークン予算の平均34.3パーセントしか使用せず、その効率性も際立っています。これは、強力なモデルが「やり方」を自律的に決めることで、性能と効率の両面で大きなメリットがあることを示しています。
モデルの能力と最適化の未来
ただし、この「委任」にはモデルの能力が重要です。中程度の最適化モデルではSkillOptがOEOを上回り、弱い最適化モデルではOEOのインターフェースを通じて機能できませんでした。これは、処方されたパイプラインが「能力依存の足場」として機能することを意味します。つまり、十分な能力を持つ最適化モデルであれば、外部からの本質的な制約は維持しつつ、測定可能なフィードバックから永続的な改善への経路を自律的に構築できるのです。私の見方では、これはAI開発における設計思想の大きな転換点です。モデルにどこまで任せるか、その境界線が常に進化していることを示しています。
最先端モデルは「何をやるか」だけでなく「どうやるか」まで自律的に決められる時代に入りました。これは指示を出す側の人間が問われるということです。私はこの流れを最速で取り込みます。一次情報を取りに行き、RO合同会社のプロダクトにすぐ反映させます。