Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating the Robustness of Text-to-image Diffusion Models against Real-world Attacks

Hongcheng Gao, Hao Zhang|arXiv (Cornell University)|Jun 16, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本論文は、誤字、同音異字置換、発音的誤りといった現実的で人間らしい入力の摂動を用いて、テキストから画像への拡散モデルを標的とした、最初のブラックボックス敵対的攻撃フレームワークを提案する。意味的整合性を保ちつつ、分布に基づく攻撃目的関数とグリーディ探索を活用することで、最小限のクエリ数と摂動率で高い成功率を達成し、Stable Diffusion や DALL-E 2 といったモデルにおける顕著な耐性の欠如を露呈する。

ABSTRACT

Text-to-image (T2I) diffusion models (DMs) have shown promise in generating high-quality images from textual descriptions. The real-world applications of these models require particular attention to their safety and fidelity, but this has not been sufficiently explored. One fundamental question is whether existing T2I DMs are robust against variations over input texts. To answer it, this work provides the first robustness evaluation of T2I DMs against real-world attacks. Unlike prior studies that focus on malicious attacks involving apocryphal alterations to the input texts, we consider an attack space spanned by realistic errors (e.g., typo, glyph, phonetic) that humans can make, to ensure semantic consistency. Given the inherent randomness of the generation process, we develop novel distribution-based attack objectives to mislead T2I DMs. We perform attacks in a black-box manner without any knowledge of the model. Extensive experiments demonstrate the effectiveness of our method for attacking popular T2I DMs and simultaneously reveal their non-trivial robustness issues. Moreover, we provide an in-depth analysis of our method to show that it is not designed to attack the text encoder in T2I DMs solely.

研究の動機と目的

  • 誤字、同音異字置換、発音的変化といった現実的で人間が生成する入力エラーに対して、テキストから画像への拡散モデルの耐性を評価すること。
  • モデルのアーキテクチャや重みの知識を必要としないブラックボックス攻撃手法を開発し、摂動における意味的整合性に焦点を当てる。
  • 攻撃が主にテキストエンコーダーを標的にしているのか、それとも拡散プロセス自体にも影響を与えているのかを調査すること。
  • 最小限の摂動とクエリ数で、画像生成を誤導する分布に基づく攻撃目的関数の有効性を実証すること。

提案手法

  • 生成分布に対する影響の大きいキーワードを、その限界的影響に基づいて特定・修正するグリーディ探索を用いたブラックボックス攻撃フレームワークを提案する。
  • 2ST および MMD 距離を具体的に用いた、新たな分布に基づく攻撃目的関数を採用し、生成画像を元のテキスト記述からずらす。
  • 誤字(Levenshtein 距離 ≤3)、視覚的に類似した文字の置換、同音語または発音的に類似した語の置換という3つの現実的なルールに従った文字レベルの摂動を適用する。
  • 個々の語に焦点を当て、文の長さを除いた真のクエリ時間の最小化により、クエリ効率の高い最適化を実現し、スパイアな攻撃を可能にする。
  • ChatGPT-GP、LAION-COCO、DiffusionDB、SBU コーパスといった複数のデータセット上で攻撃を検証し、意味的整合性を保証するための人間評価を実施する。
  • Stable Diffusion や DALL-E 2 といったモデルにおける攻撃効果を分析し、攻撃がテキストエンコーダーに限定されるのではなく、拡散プロセス自体にも影響を与えていることを確認する。

実験結果

リサーチクエスチョン

  • RQ1誤字や発音的誤りといった現実的で人間らしいテキスト摂動が、意味的整合性を保ちつつ、テキストから画像への拡散モデルを効果的に誤導できるか?
  • RQ2ブラックボックス制約下で、分布に基づく攻撃目的関数(例:2ST、MMD)は、テキストと画像の類似度をどれほど低下させられるか?
  • RQ3攻撃は主にテキストエンコーダーを標的にしているのか、それとも拡散プロセス自体にも影響を与えているのか?
  • RQ4現実世界の設定で高い攻撃成功率を達成するために、最小限の摂動率とクエリ数はどれほどか?

主な発見

  • すべてのデータセットでテキスト-画像類似度(S_I2T)が4ポイント以上低下し、人間評価での成功率は80%以上を記録した。
  • 平均して、真のクエリ時間10回未満で顕著なS_I2Tの低下を達成しており、高いクエリ効率を示した。
  • 摂動は極めて限定的で、誤字ではLevenshtein距離≤3、発音的攻撃では≤6に留まり、スパイア性が裏付けられた。
  • DALL-E 2 や Stable Diffusion といったモデルは、摂動率が低くても攻撃成功率が80%以上に達するなど、顕著な脆弱性を示した。
  • 人間評価のスコアは70以上を維持しており、修正されたプロンプトが意味的に整合的かつ自然なままであることを確認した。
  • 攻撃はテキストエンコーダーにとどまらず、拡散プロセス自体に対しても効果的であり、より広範なアーキテクチャ的脆弱性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。