Skip to main content
QUICK REVIEW

[論文レビュー] Diffusion Models for Imperceptible and Transferable Adversarial Attack

Jianqi Chen, Hao Chen|arXiv (Cornell University)|May 14, 2023
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本稿では、微細な変更でありながら高い転送性を持つ敵対的サンプルを生成するために、拡散モデルを活用する最初の敵対的攻撃フレームワークであるDiffAttackを提案する。拡散モデルの潜在空間において摂動を最適化し、その生成能力および暗黙の分類能力を活用することで、多様なモデルや防御機構に対しても高い攻撃成功率を達成しつつ、人間による認識が困難な状態を維持する。従来の手法に比べ、転送性と人間による認識困難性の両面で優れた性能を発揮する。

ABSTRACT

Many existing adversarial attacks generate $L_p$-norm perturbations on image RGB space. Despite some achievements in transferability and attack success rate, the crafted adversarial examples are easily perceived by human eyes. Towards visual imperceptibility, some recent works explore unrestricted attacks without $L_p$-norm constraints, yet lacking transferability of attacking black-box models. In this work, we propose a novel imperceptible and transferable attack by leveraging both the generative and discriminative power of diffusion models. Specifically, instead of direct manipulation in pixel space, we craft perturbations in the latent space of diffusion models. Combined with well-designed content-preserving structures, we can generate human-insensitive perturbations embedded with semantic clues. For better transferability, we further "deceive" the diffusion model which can be viewed as an implicit recognition surrogate, by distracting its attention away from the target regions. To our knowledge, our proposed method, DiffAttack, is the first that introduces diffusion models into the adversarial attack field. Extensive experiments on various model structures, datasets, and defense methods have demonstrated the superiority of our attack over the existing attack methods.

研究の動機と目的

  • 視認可能な高周波ノイズを生じさせるLpノルム制約付きの従来手法の限界を解消する。
  • 制限なし攻撃における認識困難性と転送性のトレードオフを克服し、ブラックボックスモデルに対しても堅牢性を確保する。
  • 拡散モデルが持つ自然画像生成能力および暗黙の分類能力を活用し、新たな攻撃パラダイムを構築する。
  • ピクセル空間での最適化に依存せずに、同時に転送性の向上と画像コンテンツ品質の維持を実現する手法を開発する。
  • 拡散モデルが敵対的サンプルの転送性を高める暗黙の代替モデルとして有効であることを実証する。特に、防御を施したモデルに対しても有効である。

提案手法

  • ピクセル空間ではなく、事前学習済みの拡散モデル(例:DDIM)の潜在空間において敵対的摂動を最適化することで、より自然で認識困難な摂動を実現する。
  • 攻撃損失(ターゲットモデルを誤分類)、転送性損失(複数モデル間での予測を一致)、構造保持損失(意味的コンテンツを維持)を組み合わせたマルチ損失最適化フレームワークを導入する。
  • DDIMサンプリング中にガイドランススケールを適用し、摂動の強度を制御しながら画像の忠実度を保つ。
  • ターゲット領域から注目を逸らすことで、拡散モデルの内部アテンションを操作するドリフト戦略を用い、転送性を向上させる。
  • 摂動の前段階でDDIMの逆変換を実行し、クリアな画像を潜在空間で再構築することで、構造的ずれを最小限に抑える。
  • 拡散モデルのノイズ除去プロセスを暗黙の防御として活用し、浄化ベースの防御機構に対しても耐性を高める。

実験結果

リサーチクエスチョン

  • RQ1拡散モデルは、認識困難な敵対的サンプルを生成するための潜在空間摂動のソースとして効果的に再利用可能か?
  • RQ2拡散モデルの潜在空間で最適化することで、ピクセル空間攻撃に比べて転送性が向上するか?
  • RQ3拡散モデルの生成能力と暗黙の分類能力が併せられることで、認識困難性と転送性の両方が向上するか?
  • RQ4特に浄化ベースの防御を採用するモデルに対しても、本手法は有効か?
  • RQ5拡散モデルの内部ノイズ除去プロセスは、防御機構に対する耐性向上にどの程度寄与しているか?

主な発見

  • DiffAttackは、11種類の標準モデル(代替モデルを除く)で平均74.5%のトップ1攻撃成功率を達成し、Lp制約に依存するベースライン手法を上回った。
  • FIDスコアが69.2にまで低下し、高い知覚的品質と人間による認識困難性を示しており、ピクセルベース攻撃に比べ顕著に低い。
  • 防御を施したモデルに対しても、DiffAttackは平均68.0%の攻撃成功率を維持した。これは、拡散モデル部品を除いたアブレーション手法の46.9%を上回った。
  • アブレーションスタディの結果、転送性損失を削除すると平均攻撃成功率が66.5%に低下し、クロスモデル一般化においてその重要性が確認された。
  • ガイドランススケール2.5が最適であった。Inc-v3で62.5%の攻撃成功率とFID69.2の認識困難性を両立させたが、より高い値では画像品質が劣化した。
  • 20ステップのDDIMサンプリングと30回の最適化イテレーションが、攻撃性能、画像品質、計算コストのバランスを最良に保った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。