従来のAIの課題と新しい解決策
従来の言語AIや視覚言語AIは、人間が理解しやすいような行動計画を生成する能力に優れています。しかし、これらのAIが生成する計画には、大きな課題がありました。それは、計画が必ずしも現実の環境で実行可能ではないという点です。例えば、物理法則に反するような動きを指示したり、目の前の対象物を誤って認識してしまったりすることがありました。これにより、AIが立てた計画は、机上の空論に終わってしまうことが少なくありませんでした。この問題に対処するため、新しいニューロシンボリックなAIが開発されました。このAIは、長期的な家事作業のような複雑な仕事を、より確実に実行することを目指しています。
ニューロシンボリックAIの仕組み
この新しいAIは、作業の実行を二つの主要な段階に分けて進めます。最初の段階は「目標に合わせた視覚探索」です。ここでは、視覚言語AIと探索の仕組みが連携します。AIは、自己視点からの観察や、目の前の対象物との相互作用を通じて、目標達成に必要なあらゆる情報を集めます。例えば、「コップを取る」という目標があれば、コップがどこにあるか、どんな状態かといった情報を正確に把握します。この段階で、AIは集めた情報を基に、記号的な初期状態を作り上げます。これは、AIが計画を立てるための土台となる情報です。
計画実行を確実にする二つの要素
二つ目の段階は「制約付き記号計画」です。この段階では、PDDLという計画モデルが重要な役割を果たします。PDDLは、行動のルールや制約を厳密に定義することで、AIが実行可能な行動だけを選び出すように導きます。さらに、モンテカルロ木探索。これは、将来の可能性を評価し、最適な行動を決定する手法です。この探索手法が、分野に依存しない計画のヒューリスティック。これは、特定の分野に限定されず、効率的な意思決定を助ける経験則です。これらを用いて、実行可能な行動の連鎖を評価します。これにより、AIが生成する計画は、その構造上、最初から実行できるものとして作られます。計画が現実の環境でうまくいくかは、最初の段階での視覚的な認識が正確であるかどうかにかかっています。
仮想環境での驚くべき結果
この新しいAIの性能は、VirtualHomeとALFWorldという二つの異なる仮想環境で検証されました。その結果は非常に優れており、40億から270億パラメータを持つオープンなAIが、両方の環境で90%を超える高い成功率を達成しました。さらに注目すべきは、この新しいAIの最小バージョンでも、270億パラメータを持つ直接的な視覚に基づく方針のAIと比較して、それぞれの環境で大幅に優れた成績を収めたことです。これは、AIの規模だけでなく、その設計思想が重要であることを示しています。特に、制約と探索という二つの要素の組み合わせが、この高い成功率の鍵でした。ALFWorldでの実験では、制約だけ、あるいは探索だけでは、作業の3分の1未満しか解決できませんでしたが、両方を組み合わせることで95%以上の作業を解決できました。これは、これらの要素が互いに補い合い、相乗効果を生み出すことを明確に示しています。
今後の展望と私の分析
この新しいAIは、計画生成のために必要なトークン数や、AIが認識する画像数を大幅に削減できるという利点も持っています。従来の拡張された思考や直接的な相互作用に比べて、より効率的な処理が可能です。現在のところ、残る失敗のほとんどは、計画を生成する段階ではなく、初期の状態を正確に把握する段階で発生しています。しかし、これは特別な訓練なしで達成された成果であり、今後の改善の余地が大きいことを示唆しています。私はこのアプローチが、AIが現実世界でより信頼性の高い行動をできるようになるための、非常に重要な道筋だと考えています。AIが単に「賢い」だけでなく、「確実に実行できる」ようになることは、実用化において不可欠な要素です。
PR
ElevenLabs →
AIの計画が「もっともらしい」だけでは現場では使えません。実行可能性を担保する設計が最重要です。この二段階のアプローチは、現場でぐるぐる回すための一次情報取得に役立ちます。失敗込みで、まず自分で試します。