Skip to main content
QUICK REVIEW

[論文レビュー] Attacking Adversarial Attacks as A Defense

Boxi Wú, Heng Pan|arXiv (Cornell University)|Jun 9, 2021
Adversarial Robustness in Machine Learning参考文献 61被引用数 13
ひとこと要約

本稿では、敵対的攻撃が微小な摂動に対して脆弱であるという特徴を活用し、同時にすべてのクラスを標的とする防御的ノイズを設計することで、Hedge Defenseと呼ばれる新しい防御手法を提案する。敵対的訓練を施したモデルにおいて真のクラスの局所的リプシッツ連続性が小さくなるという事実を活用することで、誤分類された敵対的例を元の正しく分類された予測に戻すことができ、CIFAR-10では最大12.5%、ImageNetでは最大5.36%のロバスト精度向上を達成する。

ABSTRACT

It is well known that adversarial attacks can fool deep neural networks with imperceptible perturbations. Although adversarial training significantly improves model robustness, failure cases of defense still broadly exist. In this work, we find that the adversarial attacks can also be vulnerable to small perturbations. Namely, on adversarially-trained models, perturbing adversarial examples with a small random noise may invalidate their misled predictions. After carefully examining state-of-the-art attacks of various kinds, we find that all these attacks have this deficiency to different extents. Enlightened by this finding, we propose to counter attacks by crafting more effective defensive perturbations. Our defensive perturbations leverage the advantage that adversarial training endows the ground-truth class with smaller local Lipschitzness. By simultaneously attacking all the classes, the misled predictions with larger Lipschitzness can be flipped into correct ones. We verify our defensive perturbation with both empirical experiments and theoretical analyses on a linear model. On CIFAR10, it boosts the state-of-the-art model from 66.16% to 72.66% against the four attacks of AutoAttack, including 71.76% to 83.30% against the Square attack. On ImageNet, the top-1 robust accuracy of FastAT is improved from 33.18% to 38.54% under the 100-step PGD attack.

研究の動機と目的

  • 敵対的訓練を施したモデルにおける自然精度とロバスト精度の間の継続的な格差を是正すること。
  • 敵対的攻撃が敵対的訓練を施したモデルに適用された際に、微小な入力摂動に対して脆弱であるかどうかを調査すること。
  • 敵対的訓練モデルの構造的性質を活用し、ランダムノイズを上回る防御手法を開発すること。
  • 下位のモデルを変更せずに、AutoAttack や Square Attack といった強力な攻撃に対してロバスト性を向上させること。

提案手法

  • Hedge Defenseは、敵対的訓練モデルにおいて真のクラスの局所的リプシッツ連続性が小さいという事実を活用し、同時にすべてのクラスを標的にする防御的摂動を生成する。
  • 損失のランドスケープを用いて、誤分類の予測はより急勾配の損失面を持つことから、摂動に対してより感受性が高いことを同定する。
  • 勾配ベースの攻撃を同時にすべてのクラスに対して並列に適用し、モデルの予測が誤分類されたクラスから離れて真のクラスに戻るように誘導する。
  • 防御的摂動は各入力例に合わせてカスタマイズされ、無差別なランダムノイズよりも高い効果を発揮する。
  • CIFAR-10 および ImageNet において実験的に検証され、線形モデルを用いた理論的分析を通じて安定性とロバスト性を示した。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練モデルに適用された敵対的攻撃は、微小な入力摂動に対して脆弱であるか?
  • RQ2敵対的訓練モデルにおける真のクラスの小さな局所的リプシッツ連続性を活用した防御的摂動を設計できるか?
  • RQ3クラスに依存しない、複数クラスを同時に標的とする攻撃戦略は、ランダムノイズや単一クラス攻撃と比較してロバスト性を向上させられるか?
  • RQ4Hedge Defenseは、AutoAttack や Square Attack といった強力なアンサンブル攻撃に対し、顕著なロバスト精度の向上を達成できるか?

主な発見

  • CIFAR-10では、Hedge Defenseにより、SOTAモデルのAutoAttackに対するロバスト精度が66.16%から72.66%に向上した。
  • Square Attack(代表的なブラックボックス攻撃)に対しては、ロバスト精度が71.76%から83.30%に向上した。
  • ImageNetでは、Hedge DefenseによりFastATのトップ-1ロバスト精度が、100ステップPGD攻撃下で33.18%から38.54%に向上した。
  • 実験的結果から、敵対的攻撃は一様にロバストではないことが示された。DeepFool や Square は微小なランダム摂動によって著しく性能が低下する一方、PGD や C&W はより耐性がある。
  • 線形モデルを用いた理論的分析により、真のクラスの損失面がより平坦であることが確認され、本手法の設計が正当化された。
  • EOT や BPDA といった厳密な攻撃に対してもHedge Defenseは耐性を示し、勾配の遮断(obfuscated gradient)問題の影響を受けないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。