[論文レビュー] Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
本稿では、敵対的プロンプト攻撃を防御するため、拡散モデル(DM)のコンセプト消去に敵対的訓練を統合する、新たなレジリエントなアンラーニングフレームワークであるAdvUnlearnを提案する。保持されたプロンプトセットに対するユーティリティを保つ正則化を用いて、テキストエンコーダーに敵対的訓練を適用することにより、AdvUnlearnは強力なレジリエンス(例:SD v1.4で21.13%の攻撃成功率)を達成するとともに、高い画像生成品質(FID ≈ 19.34)を維持し、両方の面で既存のベースラインを上回る性能を発揮する。
Diffusion models (DMs) have achieved remarkable success in text-to-image generation, but they also pose safety risks, such as the potential generation of harmful content and copyright violations. The techniques of machine unlearning, also known as concept erasing, have been developed to address these risks. However, these techniques remain vulnerable to adversarial prompt attacks, which can prompt DMs post-unlearning to regenerate undesired images containing concepts (such as nudity) meant to be erased. This work aims to enhance the robustness of concept erasing by integrating the principle of adversarial training (AT) into machine unlearning, resulting in the robust unlearning framework referred to as AdvUnlearn. However, achieving this effectively and efficiently is highly nontrivial. First, we find that a straightforward implementation of AT compromises DMs' image generation quality post-unlearning. To address this, we develop a utility-retaining regularization on an additional retain set, optimizing the trade-off between concept erasure robustness and model utility in AdvUnlearn. Moreover, we identify the text encoder as a more suitable module for robustification compared to UNet, ensuring unlearning effectiveness. And the acquired text encoder can serve as a plug-and-play robust unlearner for various DM types. Empirically, we perform extensive experiments to demonstrate the robustness advantage of AdvUnlearn across various DM unlearning scenarios, including the erasure of nudity, objects, and style concepts. In addition to robustness, AdvUnlearn also achieves a balanced tradeoff with model utility. To our knowledge, this is the first work to systematically explore robust DM unlearning through AT, setting it apart from existing methods that overlook robustness in concept erasing. Codes are available at: https://github.com/OPTML-Group/AdvUnlearn
研究の動機と目的
- アンラーニング済みの拡散モデルが敵対的プロンプト攻撃に対して脆弱であるという問題に対処すること。
- 敵対的プロンプトの脱出攻撃に耐性を持ちながらも、高い画像生成品質を維持するレジリエントなアンラーニングフレームワークを開発すること。
- アンラーニングにおける敵対的レジリエンス強化において、より効果的なモデルコンponent(テキストエンコーダー対UNet)を同定すること。
- 異なる拡散モデルアーキテクチャにわたって、レジリエントなアンラーナーをプラグアンドプレイで転送可能にする仕組みを提供すること。
- DMにおけるマシンアンラーニングの文脈において、敵対的訓練の有効性と効率性を体系的かつ包括的に調査すること。
提案手法
- 敵対的プロンプト攻撃に対するレジリエンスを向上させるために、マシンアンラーニングパイプラインに敵対的訓練(AT)を統合する。
- 敵対的訓練をUNetではなくテキストエンコーダーに特に適用するが、これは、レジリエントなアンラーニングにおいてより効果的であることが判明したためである。
- 敵対的ファインチューニング中に画像生成品質を維持するために、保持されたプロンプトセットに対するユーティリティを保つ正則化を採用する。
- アンラーニング済みモデルに対する攻撃成功確率を最大化するように、ステップバイステップの敵対的プロンプト生成戦略を用いて摂動を生成する。
- 再トレーニングなしに、他の拡散モデルに学習済みのテキストエンコーダーを簡単に統合できるようにする。
- テキストエンコーダーの最初のN層を最適化するが、アブレーションにより、より深い層の最適化が、ヌードのような複雑なコンセプトに対してより高いレジリエンスをもたらすことが示された。

実験結果
リサーチクエスチョン
- RQ1敵対的訓練を拡散モデルのアンラーニングに効果的かつ効率的に統合することで、敵対的プロンプトに対するレジリエンスを向上させることができるか?
- RQ2拡散モデルのどのコンponent(テキストエンコーダー対UNet)が、アンラーニングにおける敵対的レジリエンス強化においてより効果的か?
- RQ3敵対的アンラーニングの過程で、レジリエンスと画像生成ユーティリティのトレードオフを効果的に管理する方法は何か?
- RQ4ある拡散モデルで学習されたレジリエントなアンラーナーを、微調整なしに他のモデルに転送可能か?
- RQ5テキストエンコーダーの異なるレイヤー構成が、アンラーニングのレジリエンスとユーティリティに与える影響は何か?
主な発見
- AdvUnlearnは、ヌードのアンラーニングにおいて、SD v1.4で攻撃成功率(ASR)を100%から21.13%にまで低下させた。
- フレームワークは強力な画像生成品質を維持しており、FIDが19.34にとどまり、元のモデルの16.70とほとんど差がない。
- 敵対的レジリエンス強化において、テキストエンコーダーはUNetよりも顕著に優れており、前者はより低いASRとより良好なユーティリティトレードオフを達成している。
- AdvUnlearnで学習されたレジリエントなテキストエンコーダーは、他のモデル(例:SD v1.5、DreamShaper、Protogen)に転送可能であり、性能低下は最小限に抑えられ、SD v1.5では16.20%のASR、Protogenでは42.96%のASRを達成した。
- テキストエンコーダーのより多くの層を最適化することで、レジリエンスが向上し、全層最適化が、ヌードのような複雑なコンセプトに対して最も強力な防御をもたらした。
- ユーティリティを保つ正則化は、敵対的訓練によって通常発生する画像品質の低下を効果的に緩和し、モデルのユーティリティを維持した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。