AI生成文に「計算の来歴」を埋め込む新技術
大規模言語モデルの出力は、その生成過程を直接示す証拠を含みません。私達は「計算の来歴」という考え方を研究しました。これは、生成された文章に、その内部で実際に起きた処理の証拠を埋め込み、後から検知できるかという問いです。
内部状態を意図的に操作する仕組み
この考え方を検証するため、二つの異なる仕組みを使いました。一つはフィードフォワード型ニューラルネットワーク、もう一つはトランスフォーマー型です。これら二つのシステムは、同じ計算課題で訓練されました。課題では、答えを出すまでに二つの中間状態を経由するよう強制されます。これにより、同じ答えでも異なる内部経路を通ることが可能になります。
生成文に隠された「証拠」を見つける
私達は意図的に内部経路を切り替え、実際に使われた状態を認証しました。そして、その認証された状態に応じて、生成される文章に微細な統計的特徴を組み込みました。後からこの特徴を検知することで、どの内部状態が使われたかを特定できるかを試したのです。
実験結果とその意味
フィードフォワード型とトランスフォーマー型の両方で、この手法は成功しました。公開評価と非公開評価の計128組のペア全てで、検知器が認証された内部状態を示す信号を回復しました。また、この因果関係のある計算は、個別に訓練された複数のAIでも再現しました。ただし、別の実験では、自然に学習された中間状態を線形プローブ(内部状態を分析する手法のことです)で回復することはできませんでした。この結果は、答えが変わらなくても、検証された内部状態の情報を生成された文章に残せるという実証実験になります。
PR
文賢 →
何を生成したかだけでなく、どう生成したか。その来歴が問われる時代です。AIの判断過程を追跡できるのは、信頼の土台になります。私はこの技術で、生成AIのブラックボックスを透明化させます。