← ポッドキャスト一覧に戻る
Podcast · Episode 146

Diffusion LLMの安全性脆弱性を解明:既存モデルからの継承と新たなジェイルブレイク手法

8月15日(土) · 6分
Diffusion Large Language Models(DLLMs)は、従来の自己回帰型とは異なる並列ノイズ除去で動作しますが、その内部的な安全性メカニズムはこれまで十分に理解されていませんでした。この研究は、DLLMsを標的および攻撃者の両面から調査し、拡散ベースのアライメントにおける機械的な脆弱性を明らかにしました。既存モデルからの脆弱性継承と、それを悪用する新しいジェイルブレイク手法「SN-Guided Diffusion」が開発され、その有効性が示されています。
前のエピソードSABRE:VLMの弱点を炙り出す自動ベンチマークが登場 次のエピソードSamsung Health Assistant|Galaxyスマホ・ウォッチ・リングをつなぐAIヘルスケア戦略