Skip to main content
QUICK REVIEW

[論文レビュー] On the Robustness of Latent Diffusion Models

Jianping Zhang, Zhuoer Xu|arXiv (Cornell University)|Jun 14, 2023
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

この論文は、白箱および黒箱攻撃を用いて、潜在拡散モデル(LDMs)の耐性を調査し、特にResNetモジュールを含むノイズ除去プロセスが最も脆弱なコンponentであることを特定した。本研究では、画像変種化およびインpainting用LDMのための2つの自動データセット構築パイプラインを提案し、1,000件のテストケースからなるベンチマークを公開した。その結果、最新のモデル(例:SD-v2)は旧モデルよりも脆弱であることが判明し、トランスファー攻撃により異なるバージョン間でモデルを誤って誘導することができた。

ABSTRACT

Latent diffusion models achieve state-of-the-art performance on a variety of generative tasks, such as image synthesis and image editing. However, the robustness of latent diffusion models is not well studied. Previous works only focus on the adversarial attacks against the encoder or the output image under white-box settings, regardless of the denoising process. Therefore, in this paper, we aim to analyze the robustness of latent diffusion models more thoroughly. We first study the influence of the components inside latent diffusion models on their white-box robustness. In addition to white-box scenarios, we evaluate the black-box robustness of latent diffusion models via transfer attacks, where we consider both prompt-transfer and model-transfer settings and possible defense mechanisms. However, all these explorations need a comprehensive benchmark dataset, which is missing in the literature. Therefore, to facilitate the research of the robustness of latent diffusion models, we propose two automatic dataset construction pipelines for two kinds of image editing models and release the whole dataset. Our code and dataset are available at \url{https://github.com/jpzhang1810/LDM-Robustness}.

研究の動機と目的

  • 従来の研究がエンコーダーや出力への攻撃に限定していたのに対し、潜在拡散モデル(LDMs)の耐性を体系的かつ包括的に評価すること。
  • 現実世界の脅威モデルを反映させるために、白箱および黒箱の耐性、特にプロンプトトランスファーおよびモデルトランスファー攻撃のシナリオを調査すること。
  • LDM耐性に関する公開で高品質なベンチマークが不足している問題に対処し、2つの画像編集LDMカテゴリ(画像変種化およびインpainting)のための自動データセット構築パイプラインを提案すること。
  • 幾何変換、圧縮、ノイズといった防御メカニズムが敵対的影響を軽減する効果を評価すること。
  • 今後のLDM耐性研究を促進するために、オープンソースのコードとデータセットを提供すること。

提案手法

  • 画像変種化モデル(画像+プロンプトペア)とインpaintingモデル(画像+プロンプト+マスクトリプレット)の2つの自動データセット構築パイプラインを提案し、それぞれ500件のテストケースを生成した。
  • LDMの主要コンponent(特にエンコーダー、U-Net(ノイズ除去ネットワーク)、デコーダー)に対して白箱攻撃を適用し、脆弱性を測定した。
  • 2つの設定でのトランスファーに基づく黒箱攻撃を実施した:プロンプトトランスファー(同じプロンプトで異なるモデルを攻撃)とモデルトランスファー(同じ敵対的例で異なるモデルを攻撃)。
  • ランダムリサイズおよびパディング(R&P)、JPEG圧縮、ガウスノイズといった防御メカニズムを評価し、敵対的例の耐性を検証した。
  • 攻撃の成功度および防御効果を定量的に評価するため、CLIPスコア、PSNR、SSIM、MSSSIM、FID、ISを指標として用いた。
  • コードとデータセットを https://github.com/jpzhang1810/LDM-Robustness で公開し、再現性および今後のベンチマークの実施を可能にした。

実験結果

リサーチクエスチョン

  • RQ1潜在拡散モデルアーキテクチャ内のどのコンponentが敵対的攻撃に対して最も脆弱であるか?
  • RQ2白箱および黒箱攻撃の設定下で、画像変種化モデルとインpaintingモデルの耐性はどのように比較されるか?
  • RQ3敵対的例が異なるLDM間、特にStable Diffusionの異なるバージョン間でどの程度効果的にトランスファーされるか?
  • RQ4R&P、JPEG圧縮、ガウスノイズといった一般的な防御メカニズムは、LDMに対する敵対的攻撃をどの程度軽減できるか?
  • RQ5モデル進化(例:SD-v1からSD-v2)が敵対的耐性および継承された脆弱性に与える影響は何か?

主な発見

  • 白箱攻撃下で、特にResNetベースのU-Netモジュールを含むノイズ除去プロセスが、潜在拡散モデルで最も脆弱なコンponentである。
  • Instruct-pix2pixは、攻撃下でのCLIPスコアが高いため、標準的なStable Diffusionモデルよりも白箱攻撃に対して高い耐性を示した。
  • SD-v1モデル(例:SD-v1-4、SD-v1-5)で作成された敵対的例はSD-v2-1に効果的にトランスファーされるが、逆方向のトランスファーは限定的であるため、SD-v2-1がより脆弱であることが示唆された。
  • トランスファー攻撃の成績から、SD-v1モデルの欠陥がSD-v2に引き継がれており、SD-v2モデルはそのSD-v1の前身よりも敵対的摂動に対してより感受性であることがわかった。
  • 幾何変換(ランダムリサイズおよびパディング)は、敵対的例の耐性を顕著に向上させ、U-NetモジュールでCLIPスコアを3.95ポイント向上させたが、機能性は依然として損なわれた。
  • JPEG圧縮やガウスノイズといった防御を適用しても、敵対的例は依然として期待される画像編集機能を誤って誘導するため、現実世界の条件下では耐性が限定的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。