[論文レビュー] Stable Diffusion is Unstable
本稿では、テキスト対画像モデルに対する自己アタック(ATM)を提案する。ATMは勾配ベースで微分可能であり、語の置換または拡張に関するGumbel Softmax分布を学習することで、Stable Diffusionに対する効率的でホワイトボックス攻撃を可能にする。ATMは短いテキスト攻撃で91.1%、長いテキスト攻撃で81.2%の成功を達成し、元のプロンプトと高い意味的類似性を維持している。これにより、テキスト対画像モデルにおける4つの主要な脆弱性パターンが明らかになった。
Recently, text-to-image models have been thriving. Despite their powerful generative capacity, our research has uncovered a lack of robustness in this generation process. Specifically, the introduction of small perturbations to the text prompts can result in the blending of primary subjects with other categories or their complete disappearance in the generated images. In this paper, we propose Auto-attack on Text-to-image Models (ATM), a gradient-based approach, to effectively and efficiently generate such perturbations. By learning a Gumbel Softmax distribution, we can make the discrete process of word replacement or extension continuous, thus ensuring the differentiability of the perturbation generation. Once the distribution is learned, ATM can sample multiple attack samples simultaneously. These attack samples can prevent the generative model from generating the desired subjects without compromising image quality. ATM has achieved a 91.1% success rate in short-text attacks and an 81.2% success rate in long-text attacks. Further empirical analysis revealed four attack patterns based on: 1) the variability in generation speed, 2) the similarity of coarse-grained characteristics, 3) the polysemy of words, and 4) the positioning of words.
研究の動機と目的
- テキスト対画像生成における堅牢性の欠如、すなわち小さなプロンプト摂動によって被写体が消失するか、誤った生成が生じることを是正すること。
- 脆弱性の特定に向けた手作業による定性的なプロンプト作成の限界を克服し、自動的かつデータ駆動型の攻撃生成を可能にすること。
- モデルの不安定性を調査するための、学習可能で微分可能な方法を提供し、高類似度で効果的な敵対的プロンプトを生成すること。
- 攻撃行動の実証的分析を通じて、テキスト対画像モデルにおける体系的な失敗パターンを同定・特徴づけること。
提案手法
- ATMは温度減衰付きのGumbel Softmaxを用い、離散的な語の置換または拡張を微分可能に緩和することで、プロンプト摂動の勾配ベース最適化を可能にする。
- 二値マスクを用いて目的の名詞を保持しつつ、他の語の変更を許容することで、望ましい被写体が意味的に固定されたままになるようにする。
- 生成画像の誤分類を最大化するために、CLIP分類器とマージン損失を用いてプロンプト埋め込みを最適化する。
- 文の流れの自然さと意味的類似性の制約は、自己回帰的言語モデルとBERTScoreベースの正則化を介して適用され、プロンプトの質と一貫性を維持する。
- 攻撃はStable Diffusion上でホワイトボックス設定で訓練され、DALL·E 2 や Midjourney などの他のモデルへの転送性を可能にする。
- 訓練後、複数の攻撃プロンプトを同時にサンプリングすることで、敵対的摂動空間の効率的探索が可能になる。
実験結果
リサーチクエスチョン
- RQ1小さな、標的指定されたプロンプト摂動が加えられた際、テキスト対画像モデルに現れる主な失敗パターンは何か?
- RQ2テキスト対画像モデルに対するホワイトボックス攻撃において、敵対的プロンプト生成をどのように微分可能かつ効率的に実現できるか?
- RQ3あるモデル(例:Stable Diffusion)向けに生成された攻撃プロンプトが、DALL·E 2 や Midjourney などの他のモデルへどの程度転送可能か?
- RQ4文の自然さと意味的類似性の制約は、敵対的プロンプトの成功率と品質にどのように影響するか?
- RQ5アテンション機構やプロンプト処理におけるどのような根本的脆弱性が、被写体の無視や誤生成を引き起こすか?
主な発見
- ATMは短いテキストプロンプト攻撃で91.1%、長いテキストプロンプト攻撃で81.2%の成功を達成し、高い有効性を示した。
- 文の自然さと意味的類似性の制約を組み込むことで、テキスト類似度(TS)が0.84に向上した一方で、81.2%の高い攻撃成功率を維持した。
- ブラックボックス設定への転送性が成功し、DALL·E 2 や Midjourney に対して高品質で意味的に整合性のあるプロンプトで効果的な攻撃を生成した。
- アブレーションスタディの結果、文の自然さと意味的類似性の両方の制約を組み合わせた場合が、類似度と成功率のトレードオフにおいて最良のバランスを示し、個別の制約よりも優れた性能を示した。
- 4つの明確な攻撃パターンが同定された:生成速度のばらつき、粗い特徴の類似性、語の多義性、語の位置に依存する感受性。
- 異なるサンプラー間でも転送性が確認され、DDIMでは81.2%、より強力なDPM-Solverでは76.5%の成功率を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。