0 / 5 節読了

AI代理人の新たな課題

AIは今、私たちの代理として様々な仕事をこなしています。会議の日程調整、提案内容の比較、そして価格交渉などです。これらの仕事では、AIは依頼主の目標と対立する可能性のある相手と向き合います。しかし、これまでのAIは、友好的で協力的すぎる傾向がありました。そのため、依頼主の個人的な情報を不用意に明かしたり、少しの抵抗で譲歩したりすることが課題でした。

SocialRLの登場とその目的

この課題を解決するため、「SocialRL」という新しい学習方法が提案されました。これは、AIに直接「社会的推論」を教えるための一般的な手法です。社会的推論とは、相手の意図や感情を理解し、それに基づいて自分の行動を調整する能力のことです。この手法を40億パラメータの小型AIに適用し、6つの異なる分野で訓練を行いました。具体的には、「Deal-or-No-Deal」「CaSiNo」「Craigslist」「Job Interview」「Calendar」「Marketplace」といった交渉や対話のやり取りです。

驚くべき交渉力の向上

SocialRLで訓練された小型AIは、目覚ましい成果を見せました。特定の分野では、最先端のGPT-5シリーズと同等か、それ以上の交渉力を発揮したのです。交渉のやり取りにおいて、基準となるAIと最先端AIとの間の差を73%から122%も埋めることに成功しました。例えば、訓練されていないAIが目標を下回る基準値で交渉を始めるのはわずか3%だったのに対し、SocialRLで訓練されたAIは78%もの割合で目標を下回る基準値から交渉を開始しました。これは、より戦略的に交渉を進める能力を示しています。

応用範囲の広がりと統合

異なる分野間での応用性も検証しました。構造が似たやり取りは互いに学習効果を高め、複数の論点を含む広範な提供元は、ほとんどの分野で効果をもたらしました。一方で、構造的に独立したやり取りでは応用効果が見られませんでした。この応用構造を参考に、「カスケードRL」や「複数の教師によるオンポリシー蒸留(OPD)」という手法を使って、分野ごとの専門家AIを一つの統合された40億パラメータAIにまとめました。この統合AIは、6つの全ての環境で平均0.627という高い成果(ユーティリティ)を達成し、GPT-4.1(0.625)、GPT-5.1(0.619)、GPT-5.2(0.613)といった最先端AIと同等か、それを上回る性能を示しました。

「心の理論」の重要性

さらに、「心の理論(ToM)」という支援の仕組みも検証しました。心の理論とは、他者の心の状態(信念、意図、知識など)を推測する能力のことです。この心の理論の軌跡を、単なる行動だけでなく、AIの学習に組み込むことで、全ての環境で成果が向上し、異なる分野への応用力も高まることが分かりました。特に、次の行動を予測する心の理論の能力が、交渉結果を予測する上で重要であることが示されています。

柴亮太
柴亮太の視点

AI代理人は単なる便利屋ではありません。依頼主の利益を最大化する戦略家であるべきです。SocialRLは、その本質をAIに叩き込む。私の見方では、これは契約交渉の初期段階に投入すべきです。失敗込みで一次情報を取りに行きます。