タスクベクトル減算とは何か?
AIモデルの振る舞いを変更する手法として、タスクベクトル演算が注目されています。これは、特定のタスクに対応するベクトルをモデルから加算または減算することで、そのモデルの能力を調整する技術です。例えば、ロボットに「物を掴む」スキルを教えるベクトルを加える、あるいは「特定の物を避ける」スキルを減算する、といった応用が考えられます。この手法の魅力は、データや勾配計算なしで高速にモデルを編集できる点にあります。
しかし、特にロボットのような物理世界で動作する「具現化されたAI」において、この編集が局所的に機能するか、つまり意図したスキルだけが変更され、他のスキルには悪影響がないかという点は不明瞭でした。本研究は、この「局所性」をクローズドループ、すなわちロボットが実際に動作する環境で評価することを目的としています。マルチタスクをこなすVision-Language-Action(VLA)ポリシーから、特定のスキルベクトルを減算した場合に何が起きるかを詳細に監査しました。
監査で明らかになった3つの挙動パターン
LIBERO-Goalというロボットタスクセットの10種類のスキルに対して、スキルベクトル減算を適用した結果、3つの異なる挙動パターンが観察されました。
まず、5つのスキルでは「ターゲット制御の分離」が見られました。これは、減算したターゲットスキルは成功率0%で完全に抑制されるものの、他のスキルへの悪影響は比較的限定的であったケースです。しかし、この場合でも、他のスキルの制御維持率は平均で52%に留まり、完全に無傷というわけではありませんでした。
次に、3つのスキルでは「抵抗」が見られました。ここでは、ターゲットスキルを減算しても、そのスキルが完全に抑制されず、一定の成功率を維持してしまうという現象です。モデルが特定のスキルを強く保持しようとする傾向が示唆されます。
最後に、2つのスキルでは「グローバルな崩壊」が発生しました。これは、ターゲットスキルを減算した結果、そのスキルだけでなく、他の無関係なスキルやシステム全体に深刻な悪影響が及び、ロボットがほとんど何もできなくなる状態を指します。このパターンは、タスクベクトル減算の危険性を最も強く示唆するものです。
意図せぬ副作用と手法の限界
今回の監査では、ターゲットスキルを抑制できた場合でも、少なくとも1つの nominally unrelated control(名目上無関係な制御スキル)に実質的な害が及ぶことが確認されました。これは、タスクベクトル減算が局所的に機能するとは限らず、予期せぬ副作用を引き起こす可能性があることを意味します。
また、アクションヘッドの種類(連続回帰、離散トークン、フローマッチング)に関わらず、Goalパネルのタスクでは比較的良好な分離が見られましたが、Spatial、Object、Long-horizonといった他のパネルでは、明確な分離が見られず、制御の崩壊が観察されました。これは、タスクの種類やモデルのアーキテクチャによって、タスクベクトル減算の効果が大きく異なる可能性を示しています。
興味深いことに、タスクベクトルのコサイン類似度だけでは、これらの挙動の変動を説明できませんでした。これは、ベクトルの方向性だけでなく、より複雑なモデル内部の相互作用が影響していることを示唆しています。研究では、この現象が「行動マスキング」によるものであり、完全にスキルが「アンラーニング(忘却)」されたわけではない可能性も指摘されています。つまり、スキルが一時的に隠されているだけで、完全に消去されたわけではないということです。
私の見方:高速だが脆い介入
タスクベクトル減算は、データや勾配計算を必要とせず、高速にモデルを編集できるという点で非常に魅力的です。特に、緊急の修正や迅速なプロトタイピングにおいては、そのスピードが大きな利点となります。しかし、今回の研究結果は、その「高速性」と引き換えに「脆さ」を抱えていることを明確に示しています。
私の経験上、AIプロダクトを開発・運営する中で、モデルの振る舞いを変更する際には、常に意図せぬ副作用のリスクを考慮する必要があります。特に、物理世界で動作するロボットの場合、単一のスキル変更がシステム全体の安全性や信頼性に致命的な影響を与える可能性があります。
この研究は、具現化されたモデル編集においては、単にターゲットスキルが抑制されたかどうかだけでなく、他のスキルへの影響やシステム全体の安定性を、クローズドループ環境で徹底的に評価することの重要性を強調しています。高速な介入は魅力的ですが、その脆さを理解し、慎重に適用することが、実用化への鍵を握ると考えます。
PR
ElevenLabs →
AIモデルのスキル編集は、表面的な変更に留まると痛い目に遭います。一次情報を取りに行くと、必ずシステムの脆さに直面するものです。設計段階から、副作用をどこまで許容するか、徹底的に議論すべきです。