ヒューマノイドが抱える課題
人型機械は、私たちの生活環境で多様な役割を果たす可能性を秘めています。しかし、その実現には大きな壁がありました。特に、全身を使った移動と腕の操作を同時に行う「全身移動操作」は非常に難しい課題です。既存の汎用VLAモデル(視覚・言語・行動を統合するAIモデル)では、この複雑な動きを効果的に制御できませんでした。全身の動きは非常に多くの要素からなり、それらが互いに深く関係し合っています。そのため、一つの指示で全ての動きを生成しようとすると、不自然な動きになってしまうのです。
また、オフライン学習で得られた制御方法(ポリシー)は、実世界での利用時に最適ではない場合があります。実世界での経験を通じて制御方法を改善するオンライン強化学習は有効ですが、大規模なVLAモデルの主要部分(バックボーン)を直接調整するには、膨大な計算資源と時間が必要です。さらに、実機での試行錯誤は、安全性へのリスクも伴います。これらの課題が、人型機械の実用化を妨げていました。
HAFの二段階アプローチ
これらの課題を解決するため、HAF(Humanoid Adaptation Framework)という新しい枠組みが提案されました。HAFは、既存の汎用VLAモデルを人型機械の全身移動操作に応用するための二段階の仕組みです。一つ目は「HAF-VLA」、二つ目は「HAF-Steer」です。
HAF-VLAは、階層的な行動生成器です。これは、事前学習済みのVLAモデルを基盤としています。全身の行動生成を三つの段階に分け、順番に処理します。各段階には専用の埋め込み情報と、段階間の記憶(KVキャッシュ)が組み込まれています。これにより、運動学的な依存関係を保ちながら、一括生成で起こりがちな不自然な全身動作を防ぎます。私はこの仕組みが、複雑な動きを分解して考える点で非常に理にかなっていると感じます。
実世界での効果と私の見方
HAF-VLAの上に構築されるHAF-Steerは、潜在空間でのオフラインからオンライン強化学習の仕組みです。これは、流れの一致性というVLAモデルの特性と、DCT(離散コサイン変換)という次元削減技術を活用します。これにより、強化学習の最適化をコンパクトなノイズ空間に限定できます。大規模なVLAモデルの主要部分を更新する必要がありません。結果として、効率的な実世界での制御方法の改善が可能になります。計算コストを抑えつつ、実機での安全性を高める工夫です。
HAFは、七つの実世界の人型機械の移動操作タスクで評価されました。その結果、従来の単一段階のVLAモデルを上回り、全身の協調性とタスク達成度が向上しました。私の見方では、この技術は人型機械が人間社会でより自然に、そして安全に活動するための重要な一歩です。既存の高性能なVLAモデルを、特定の機械に合わせて最適化するこのアプローチは、今後のAIとロボット技術の融合において、非常に有効な方向性だと考えます。
PR
ElevenLabs →
人型機械の全身制御は、AIの腕の見せ所です。既存のVLAモデルをそのまま使っても、実世界では通用しません。HAFのように、動きを分解し、効率的なオンライン学習でぐるぐる回す設計が正解です。私の経験上、このアプローチが最速で一次情報を掴めます。