[論文レビュー] To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For Now
本稿では、生成モデルの分類能力を活用して安全対策によるアンラーニング機構を回避する、新たな敵対的プロンプト手法UnlearnDiffを提案する。実験の結果、最先端のアンラーニング済み拡散モデルですら、同様の攻撃に対して極めて脆弱であることが示され、UnlearnDiffはヌード分類タスクにおいて最大90.27%の攻撃成功率を達成した。これは、現在の安全対策における根本的な耐性の欠如を露呈している。
The recent advances in diffusion models (DMs) have revolutionized the generation of realistic and complex images. However, these models also introduce potential safety hazards, such as producing harmful content and infringing data copyrights. Despite the development of safety-driven unlearning techniques to counteract these challenges, doubts about their efficacy persist. To tackle this issue, we introduce an evaluation framework that leverages adversarial prompts to discern the trustworthiness of these safety-driven DMs after they have undergone the process of unlearning harmful concepts. Specifically, we investigated the adversarial robustness of DMs, assessed by adversarial prompts, when eliminating unwanted concepts, styles, and objects. We develop an effective and efficient adversarial prompt generation approach for DMs, termed UnlearnDiffAtk. This method capitalizes on the intrinsic classification abilities of DMs to simplify the creation of adversarial prompts, thereby eliminating the need for auxiliary classification or diffusion models. Through extensive benchmarking, we evaluate the robustness of widely-used safety-driven unlearned DMs (i.e., DMs after unlearning undesirable concepts, styles, or objects) across a variety of tasks. Our results demonstrate the effectiveness and efficiency merits of UnlearnDiffAtk over the state-of-the-art adversarial prompt generation method and reveal the lack of robustness of current safetydriven unlearning techniques when applied to DMs. Codes are available at https://github.com/OPTML-Group/Diffusion-MU-Attack. WARNING: There exist AI generations that may be offensive in nature.
研究の動機と目的
- 敵対的プロンプトに対する安全対策に基づくアンラーニング済み拡散モデルの耐性を評価すること。
- テキストから画像に変換する拡散モデルにおけるアンラーニング耐性のための体系的でない評価フレームワークの欠如を是正すること。
- 拡散モデル自身の分類能力を活用することで、敵対的プロンプト生成を簡素化する手法を開発すること。
- 複数のアンラーニングタスクおよびモデルバージョンを対象に、アンラーニング機構の有効性をベンチマークすること。
提案手法
- UnlearnDiffは、拡散モデルの内部分類器ヘッドを活用し、画像分類における敵対的攻撃と同様の方法で敵対的プロンプト生成を誘導する。
- 攻撃をテキスト埋め込み空間における最適化問題として定式化し、摂動を加えたプロンプト下で不適切な画像を生成する確率を最大化する損失関数を用いる。
- 外部モデルや追加学習に依存せず、分類器ヘッドを備えた任意のテキストから画像への拡散モデルに直接適用可能であり、効率的である。
- 勾配ベースの更新を繰り返し行う最適化により、アンラーニング機構をわずかに回避しつつ意味的整合性を保った敵対的プロンプトを生成する。
- Stable Diffusionベースの多様なモデルを用いて、ヌード、暴力、著作権のあるスタイルなど複数のアンラーニングタスクで評価を行う。
- 異なるStable Diffusionバージョン間での転送性をテストし、モデルアーキテクチャやデータ分布の変化に対しても攻撃の汎用性が示された。

実験結果
リサーチクエスチョン
- RQ1敵対的プロンプトは、拡散モデルの安全対策に基づくアンラーニング機構を効果的に回避できるか?
- RQ2アンラーニングを回避するための微小で最適化されたテキスト摂動に対して、現在のアンラーニング済み拡散モデルはどの程度耐性を示すか?
- RQ3モデル自身の分類能力を用いて生成された敵対的プロンプトは、どの程度高い攻撃成功率を達成できるか?
- RQ4攻撃性能は、異なる拡散モデルバージョンやアンラーニングタスクにおいてどのように変化するか?
- RQ5ランダムなプロンプトやノイズシードの摂動もアンラーニング機構を回避できるか?これはモデルの本質的脆弱性を示唆する。
主な発見
- Stable Diffusion v1.4で微調整されたESDモデルのヌードアンラーニングタスクにおいて、UnlearnDiffは90.27%の攻撃成功率を達成し、P4Dなどの先行手法を大きく上回った。
- v1.4ベースの攻撃対象モデルからv2.1ターゲットモデルへの転送においても、54.87%の高い効果性(ASR)を維持した。これは、攻撃の強力な汎用性を示している。
- ランダムなテキストプロンプト攻撃では57.75%の成功率が得られ、ランダムなノイズシード攻撃では14.01%に達した。これは、非最適化・確率的摂動に対してもアンラーニング機構が脆弱であることを示している。
- SD v2.0を標的とした場合、攻撃性能は低下したが、依然として42.48%のASRを示した。これは、より厳格なNSFWフィルタリングが存在するにもかかわらず、根本的な脆弱性が残存していることを示している。
- フィルタリング済みデータセットで学習されたアンラーニング済み拡散モデルですら、不適切な概念をしっかりアンラーニングできないことが判明した。これは、現在の安全設計に基づくアプローチに根本的な欠陥があることを示している。
- 本研究は、現在の安全対策に基づくアンラーニングが不十分であることを露呈した。微小な敵対的プロンプトですら、信頼性を持って不適切な出力を生成できることから、これらのモデルの信頼性に疑問が呈された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。