柴亮太の
AI最前線
最新
基礎
タイムライン
ポッドキャスト
About
☰
×
最新
基礎
タイムライン
ポッドキャスト
About
← ポッドキャスト一覧に戻る
Podcast · Episode 227
AI安全スコアの落とし穴:有害プロンプトの成功を「安全」と誤認する問題
8月19日(水) · 5分
AIモデルの内部安全性スコアが、有害なプロンプトによるジェイルブレイク攻撃を「安全」と誤認している問題が浮上しました。プロンプトの有害な意図と攻撃の成功は別物であり、この誤認がAIシステムの脆弱性を高める可能性があります。研究では、攻撃が危険になるほど内部スコアがそれを安全と評価する逆転現象が確認され、既存の安全性評価手法への再考が求められています。
元記事を読む →
前のエピソード
動画生成の品質と多様性を両立:DUETモデルが2ステップ生成の課題を克服
次のエピソード
Ghostjacking|Cloudflare実証、遮断ログがAIへの命令経路に