何が問題か:AIツール利用における履歴の罠
AIエージェントがツールを利用する際、過去の対話履歴やツールの使用履歴を参考に、現在のタスクの状態を推論します。しかし、この履歴が現在の要求に対して「誤解を招く」情報を含んでいる場合、エージェントは間違った判断を下す可能性があります。これは「履歴汚染」と呼ばれ、特に持続的な対話において顕著な問題です。私が見るに、これは単なるノイズではなく、モデルが持つ本来の能力を阻害する深刻な問題です。
履歴汚染が引き起こす具体的な影響
本研究では、Qwen3-1.7Bモデルにおいて、履歴汚染が正しい意思決定の32.1%を誤らせることを明らかにしました。これは、過去の破損したエンティティやインターフェースの慣習を再利用させるなど、エージェントの振る舞いを大きく歪めます。本来であれば正しい判断を下せるはずのモデルが、過去の不適切な情報に引きずられてしまうのです。これは、AIエージェントを実運用する上で、過去の情報の取り扱いがいかに難しいかを痛感させる結果です。
新しい評価ベンチマーク「bench」の導入
この履歴汚染問題を詳細に評価するため、新しいベンチマーク「bench」が開発されました。このベンチマークは、オリジナルの履歴、汚染された履歴、そして正しい状態を示す「Oracle State」の3つの視点を同期させて提供します。これにより、意思決定の状態、エンティティの結合、インターフェースの実行といった具体的な失敗箇所を特定できます。これにより、開発者はより的確な改善策を講じることが可能になります。
画期的な解決策「ours」のメカニズム
提案された解決策「ours」は、信頼できる「Oracle State」を知る教師モデルのポリシーを、汚染された履歴しか見ない生徒モデルに転移させる手法です。生徒モデルが生成するプレフィックスに対してソフトな教師あり学習を行うことで、この転移を実現します。Qwen3-1.7Bモデルにおいて、この手法は87.0%のBalanced Tool-Use Accuracyを達成し、既存手法(Gold-SFT 66.3%、Oracle sequence distillation 82.3%など)を大きく上回りました。さらに、8Bの教師モデルを使うことで、1.7Bの生徒モデルでも91.9%まで精度が向上します。
業界への示唆と今後の展望
この研究は、履歴の信頼性がAIツール利用の性能を左右する重要なボトルネックであることを明確に示しました。今回の成果は、クリーンな履歴、未知の関数、外部ベンチマーク、ノイズの多い多段階質問応答など、幅広いシナリオで有効性が確認されており、実用化への大きな一歩です。この「信頼できる状態ポリシー転移」が、より複雑なエージェントシステムにどのように応用されていくかが注目されます。私自身の経験からも、過去の情報の適切な管理はAIシステムの安定稼働に不可欠だと断言できます。
PR
ElevenLabs →
AIエージェントの履歴汚染は実運用で必ず直面する問題です。過去の情報をどう取捨選択し、いつ「忘れる」かが設計者の腕の見せ所。この研究は、その一次情報として非常に価値が高い。私もRO合同会社のプロダクトにすぐ組み込み、最速で検証します。