多段階攻撃の脅威
大規模言語モデル(LLM)は、多段階の脱獄攻撃に直面しています。 これは深刻な安全上の問題です。 悪意ある目的が、無害に見えるやり取りに分解されます。 そして、安全対策をすり抜けていました。 既存の防御策は、変化する操作の手口を見抜く推論能力が足りません。 デリケートな話題で、無害な要求まで過剰に拒否しがちです。 結果として、有用性が損なわれていました。
新しい防御策「Trace」の仕組み
新しい防御策「Trace」が登場しました。 これは履歴を考慮した構造的な推論を行う仕組みです。 応答を生成する前に、この仕組みは会話の流れから操作の兆候を見つけます。 ユーザーの意図を、無害なものと悪意あるものの両方で評価します。 そして、脱獄スコアを割り当てます。 その後、「許可」「警告」「拒否」のいずれかの行動を決定します。
訓練と評価の成果
私たちは4000件の複数ターン悪意ある会話を集めました。 これらは5つの攻撃の枠組みから来ています。 さらに、2400件の無害な対話と600件のデリケートだが無害な会話も用意しました。 これらを用いて、Llama-3.1-8B-Instructというモデルを訓練しました。 SFT(教師ありファインチューニング)。これは、事前に用意されたデータでそのモデルを訓練する手法です。 GRPO(汎用報酬最適化)。これは、多様な目標を統合して学習を進める方法です。 複数の要素からなる報酬で、有用性と脱獄試行への堅牢性を同時に高めました。
攻撃成功率の大幅な改善
7つの複数ターン攻撃評価で、Traceは平均攻撃成功率(ASR)を14.5%に抑えました。 ASRは、攻撃が成功した割合を示す数値です。 最強の基準となる仕組みは31.4%でした。 防御されていないモデルでは74.9%でした。 Traceは、脱獄を成功させるために必要な攻撃者の労力を大幅に増やします。 また、使いやすさと安全性のバランスも取れています。 過剰拒否の評価基準では、平均93.3%の適合性を達成しました。
ポッドキャスト燎RYOU課 ポッドキャスト
ポッドキャストを聴く →
多段階攻撃は、AIの安全対策をぐるぐる回す最悪の手口です。Traceのような防御策は必須です。私はまず、自社AIの営業トークにこの仕組みを組み込みます。一次情報で堅牢性を確認します。