Skip to main content
QUICK REVIEW

[論文レビュー] Threat Model-Agnostic Adversarial Defense using Diffusion Models

Tsachi Blau, Roy Ganz|arXiv (Cornell University)|Jul 17, 2022
Adversarial Robustness in Machine Learning被引用数 14
ひとこと要約

この論文は、事前学習済みの拡散モデルを用いた確率的画像ノイズ除去によって、脅威モデルに依存しない敵対的防御を提案する。攻撃を受けた画像にi.i.d.のガウスノイズを追加し、拡散プロセスを繰り返し適用してノイズ除去することで、敵対的摂動を効果的に除去しながら意味的コンテンツを保持する。分類器の再訓練を必要とせず、多様な攻撃タイプにおいて最先端の耐性を達成する。

ABSTRACT

Deep Neural Networks (DNNs) are highly sensitive to imperceptible malicious perturbations, known as adversarial attacks. Following the discovery of this vulnerability in real-world imaging and vision applications, the associated safety concerns have attracted vast research attention, and many defense techniques have been developed. Most of these defense methods rely on adversarial training (AT) -- training the classification network on images perturbed according to a specific threat model, which defines the magnitude of the allowed modification. Although AT leads to promising results, training on a specific threat model fails to generalize to other types of perturbations. A different approach utilizes a preprocessing step to remove the adversarial perturbation from the attacked image. In this work, we follow the latter path and aim to develop a technique that leads to robust classifiers across various realizations of threat models. To this end, we harness the recent advances in stochastic generative modeling, and means to leverage these for sampling from conditional distributions. Our defense relies on an addition of Gaussian i.i.d noise to the attacked image, followed by a pretrained diffusion process -- an architecture that performs a stochastic iterative process over a denoising network, yielding a high perceptual quality denoised outcome. The obtained robustness with this stochastic preprocessing step is validated through extensive experiments on the CIFAR-10 dataset, showing that our method outperforms the leading defense methods under various threat models.

研究の動機と目的

  • 未観測の敵対的脅威モデルに一般化できる防御機構の開発。特異的脅威に依存する敵対的訓練の限界を克服すること。
  • 生成モデルを前処理に活用した堅牢化手法の構築。分類器の再訓練を必要とせず、あらゆる事前学習済み分類器を防御可能にすること。
  • 拡散サンプリングを用いて摂動を施された画像を綺麗な画像多様体に戻すことで、多様な敵対的攻撃に対して高い耐性を達成すること。
  • 軽量な拡散サンプリング戦略と部分サンプリングステップを用いることで、計算効率を確保するとともに、強力な攻撃に対して耐性を持つこと。

提案手法

  • 攻撃を受けた入力画像にi.i.d.のガウスノイズを追加し、それを事前学習済みの拡散モデルに供給する。
  • 拡散プロセスは、最小平均二乗誤差(MMSE)ノイズ除去器を用いた反復的ノイズ除去と、ランジュバンダイナミクスによる制御されたノイズ注入を含む。
  • 特定の拡散ステップにおけるノイズのついた攻撃画像からサンプリングを開始することで、綺麗な画像分布への条件付き生成が可能になる。
  • 拡散ステップ数を調整することで、知覚的忠実性と摂動除去のトレードオフを最適化する。
  • DDIM拡散スケジュールの最初のT*ステップのみを用いることで、計算コストを削減し、攻撃者にとっての困難を増加させる。
  • 分類器と拡散モデルは、綺麗な画像上で独立して訓練されるため、モデルに依存せず、脅威モデルに依存しない防御が実現される。

実験結果

リサーチクエスチョン

  • RQ1拡散ベースの前処理手法は、多様で未観測の敵対的脅威モデルに耐性を示せるか?
  • RQ2拡散ステップ数は、摂動除去と知覚的品質のトレードオフにどのように影響するか?
  • RQ3確率的かつ微分不能な防御機構は、期待値変換(EOT)と勾配ベース最適化を用いた強力なホワイトボックス攻撃に耐えられるか?
  • RQ4綺麗なデータ上で事前学習された拡散モデルを用いることで、学習時に見られなかった攻撃に対しても効果的な一般化が可能になるか?

主な発見

  • 提案手法は、$L_∞$および$L_2$攻撃を含む複数の脅威モデルにおいて、CIFAR-10で最先端のロバスト精度を達成した。
  • $\epsilon = 8/255$および$\epsilon = 16/255$の$L_\infty$脅威モデル下でも、ロバスト精度が90%を超えた。既存の防御ベースラインを上回った。
  • 14ステップの部分サンプリング拡散スケジュールを用いることで、最も強力な既知の攻撃(ホワイトボックス+EOT)に対しても高いロバスト性を維持した。
  • ロバストネスがピークに達する最適な拡散深さが存在する。ステップ数が少なすぎると摂動が除去されず、多すぎると知覚的品質が劣化し、精度が約10%まで低下する。
  • 分類器の再訓練や攻撃タイプの知識を必要としないため、本質的に脅威モデルに依存しない。
  • 確率的かつ微分不能な拡散サンプリングプロセスのおかげで、計算効率が高く、攻撃に対して耐性を持つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。