WNM-3Dとは何か
WNM-3Dは、「3Dシーン条件付けによる世界ナビゲーションモデル(World Navigation Model with 3D scene conditioning)」を意味します。これは、連続的な視覚言語ナビゲーション(VLN)を目的とした生成モデルです。エージェントが言語指示に従い、環境内で自律的に移動する際に、周囲の3D空間情報を深く理解し、自身の動きによって未来の視覚がどのように変化するかを予測する能力を持たせることが特徴です。これにより、より堅牢で信頼性の高いナビゲーションが実現します。
従来のVLNシステムの課題
従来の視覚言語ナビゲーション(VLN)システム、特に事前学習済み視覚言語モデル(VLM)を基盤とするものは、観察結果と言語指示を直接ナビゲーション行動にマッピングする手法が主流でした。しかし、これらの行動中心の学習では、エージェントが予測した動きに対して、その視覚的観察がどのように変化すべきかを明示的にモデル化していませんでした。また、未来の観察と行動を共同で予測する生成的な世界行動モデル(WAM)も存在しますが、連続的なVLN向けに、観察履歴から推論される幾何学認識表現に基づいて未来の視覚と行動の生成を条件付けるものはありませんでした。
WNM-3Dの革新的なアプローチ
WNM-3Dは、これらの課題を解決するために革新的なアプローチを採用しています。まず、過去の観察を永続的なシーンコンテキストに統合するため、フローズンなフィードフォワード幾何学エンコーダが、単眼の自己中心的なRGB履歴から幾何学認識表現を抽出します。次に、学習可能な3Dシーン・トゥ・トークンアダプターが、これらを世界行動拡散トランスフォーマーのトークン空間における固定長プレフィックスに変換します。このプレフィックスは、ブロック因果的アテンションを通じて、将来のすべてのビデオ行動ブロックを条件付けし、将来の視覚生成と行動生成の両方に共有の幾何学的コンテキストを提供します。
実験結果と今後の展望
WNM-3Dは、A*アルゴリズムで生成されたデモンストレーションに対する教師あり世界行動ファインチューニング、ポリシーが訪問した状態に対するDAggerスタイルの適応、およびDanceGRPOベースの閉ループポリシー最適化を通じて学習されました。GN-Benchでの実験結果は、WNM-3Dが強力なVLMベースのナビゲーションポリシーや、2D条件付けされた同等モデルを閉ループナビゲーションにおいて上回ることを示しています。また、固定された目標付近の評価セットでは、より高いフロー行動の一貫性と低い視覚運動誤差を達成しました。この技術は、自律移動ロボットやAIエージェントの性能を飛躍的に向上させる可能性を秘めています。
学習コースAI活用アカデミー
コース一覧を見る →
3Dシーンを理解してナビゲーションする。これは自律エージェントの基本です。未来の視覚変化を予測できるのは大きい。机上の空論ではなく、現実世界でどれだけぐるぐる回せるか。自分はまず、倉庫内のピッキングロボットに適用を考えます。