Skip to main content
QUICK REVIEW

[論文レビュー] Internal Wasserstein Distance for Adversarial Attack and Defense

Wang, Qicheng, Shuhai Zhang|arXiv (Cornell University)|Mar 13, 2021
Adversarial Robustness in Machine Learning参考文献 34被引用数 4
ひとこと要約

本稿では、画像間の意味的類似性を測定するための内部 Wasserstein 距離(IWD)を提案し、より効果的な adversarial 攻撃および防御を可能にする。IWD を用いて多様で意味的に類似した adversarial 例を生成することで、ℓp に基づく手法よりも大きな摂動を達成し、IWD を用いた adversarial 訓練により耐性を向上させ、ImageNet における攻撃成功率と防御精度の両面で既存手法を上回る。

ABSTRACT

Deep neural networks (DNNs) are known to be vulnerable to adversarial attacks that would trigger misclassification of DNNs but may be imperceptible to human perception. Adversarial defense has been an important way to improve the robustness of DNNs. Existing attack methods often construct adversarial examples relying on some metrics like the $\ell_p$ distance to perturb samples. However, these metrics can be insufficient to conduct adversarial attacks due to their limited perturbations. In this paper, we propose a new internal Wasserstein distance (IWD) to capture the semantic similarity of two samples, and thus it helps to obtain larger perturbations than currently used metrics such as the $\ell_p$ distance. We then apply the internal Wasserstein distance to perform adversarial attack and defense. In particular, we develop a novel attack method relying on IWD to calculate the similarities between an image and its adversarial examples. In this way, we can generate diverse and semantically similar adversarial examples that are more difficult to defend by existing defense methods. Moreover, we devise a new defense method relying on IWD to learn robust models against unseen adversarial examples. We provide both thorough theoretical and empirical evidence to support our methods.

研究の動機と目的

  • Adversarial 例における意味的類似性を測るための ℓp 範囲の限界を是正すること。これは摂動の多様性と効果性を制限する要因である。
  • データ多様体構造を活用することで、より多様で強固な adversarial 例を生成する新たな攻撃手法の開発。
  • IWD を用いた防御機構の設計により、未観測の adversarial 攻撃に対する一般化性と耐性を向上させること。
  • 攻撃誤差の上界を理論的に導出し、IWD を用いた訓練による耐性の高い防御の設計を支援すること。
  • データ多様体の盲点をカバーする多様な adversarial 例を生成することで、DNN の一般化性と耐性が向上することを実証すること。

提案手法

  • 従来の ℓp 範囲に代えて、IWD を用いてデータの内在的分布と画像間の意味的類似性を捉えるメトリクスとして提案する。
  • データ多様体上での大きな意味的に一貫した摂動を持つ adversarial 例を生成する攻撃手法(IWDA)を構築する。
  • IWD を用いて攻撃分類誤差の上界を導出し、新たな防御手法(IWDD)の設計を支援する。
  • IWD を最適化した adversarial 例を用いてモデルを訓練する防御戦略(IWDD)を設計し、未観測攻撃に対する耐性を向上させる。
  • 学習された特徴空間を介して IWD を計算する二重最適化フレームワークを採用し、効果的な勾配ベース攻撃と耐性の高い訓練を実現する。
  • 事前学習済みモデル(例:ResNet-101, Inception-v3)を用い、tiny ImageNet を用いて攻撃および防御性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1ℓp 範囲以外のメトリクスが、効果的な adversarial 例を生成するための意味的類似性をよりよく捉えることができるか?
  • RQ2多様で意味的に一貫した摂動を実現しつつ、より大きな摂動を達成するにはどうすればよいか?
  • RQ3IWD を用いた adversarial 訓練は、未観測の adversarial 攻撃に対して耐性を向上させることができるか?
  • RQ4IWD と攻撃成功率の理論的関係は何か? そして、それは防御設計を支援するのにどう寄与するか?
  • RQ5データ多様体上での adversarial 例の生成は、DNN の一般化性と耐性を向上させるか?

主な発見

  • IWDA は、すべての手法の中で最大の平均 ℓ2 および ℓ∞ 推定距離を達成しており、ユークリッド空間における大きな adversarial 推定を示している。
  • 大きなユークリッド空間の摂動にもかかわらず、IWDA は最小の IWD 値(ほぼゼロ)を維持しており、元の画像と adversarial 画像との間で高い意味的類似性が保たれていることを確認している。
  • IWDD は、PGD-10 および FWAdv 攻撃において、最先端の防御手法と同等またはそれ以上の耐性を達成しており、クリーン精度にわずかな妥協しか生じない。
  • アブレーションスタディの結果、IWDA および IWDD の両方において、τ=0.1 および β=0.1 がクリーン精度と耐性精度の最良のトレードオフをもたらすことが判明した。
  • 定性的な結果から、IWDA は、解像度や滑らかさを歪ませる既存手法とは異なり、多様で現実的で意味的に不変な adversarial 例を生成している。
  • 理論的分析により、データ多様体の盲点をカバーする多様な adversarial 例が耐性を向上させることを確認し、ImageNet における実証的検証によって裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。