Skip to main content
QUICK REVIEW

[論文レビュー] An ADMM-Based Universal Framework for Adversarial Attacks on Deep Neural Networks

Pu Zhao, Sijia Liu|arXiv (Cornell University)|Apr 9, 2018
Adversarial Robustness in Machine Learning被引用数 15
ひとこと要約

この論文は、深層ニューラルネットワークにおける $L_0$、$L_1$、$L_2$、$L_\infty$ の adversarial attack を統一する ADMM に基づく汎用フレームワークを提案している。最小限の歪みで、非常に効果的かつ最適化駆動の adversarial example の生成が可能であり、あらゆるノルムで 100% の攻撃成功率と最先端の歪み低減性能を達成している。C&W や EAD 攻撃を含む先行手法を上回っている。

ABSTRACT

Deep neural networks (DNNs) are known vulnerable to adversarial attacks. That is, adversarial examples, obtained by adding delicately crafted distortions onto original legal inputs, can mislead a DNN to classify them as any target labels. In a successful adversarial attack, the targeted mis-classification should be achieved with the minimal distortion added. In the literature, the added distortions are usually measured by L0, L1, L2, and L infinity norms, namely, L0, L1, L2, and L infinity attacks, respectively. However, there lacks a versatile framework for all types of adversarial attacks. This work for the first time unifies the methods of generating adversarial examples by leveraging ADMM (Alternating Direction Method of Multipliers), an operator splitting optimization approach, such that L0, L1, L2, and L infinity attacks can be effectively implemented by this general framework with little modifications. Comparing with the state-of-the-art attacks in each category, our ADMM-based attacks are so far the strongest, achieving both the 100% attack success rate and the minimal distortion.

研究の動機と目的

  • 深層ニューラルネットワークにおける $L_p$ ノルム($L_0$、$L_1$、$L_2$、$L_\infty$)の複数のノルムにわたる adversarial example の生成のための統一フレームワークの欠如に取り組むこと。
  • 最小限の歪みを実現しながら高い攻撃成功率を達成する汎用的な最適化ベースの攻撃手法を開発すること。
  • 防御蒸留や adversarial training などの防御メカニズムが、提案された攻撃に対してどれほど頑健であるかを評価すること。
  • ADMM を用いたフレームワークによって生成された adversarial example が、異なるモデルや防御技術間でどれほど転送可能であるかを調査すること。

提案手法

  • 非凸的かつ組合せ的な最適化問題としての adversarial attack 生成問題を、反復的更新と制約強制の2つの部分問題に分解するために、交替方向乗数法(ADMM)を活用する。
  • ADMM の交替最小化と拡張ラグランジュの枠組みを用いて、$L_p$ ノルム制約付き最適化問題を効率的に解き、線形収束率を達成する。
  • 拡張ラグランジュ関数における正則化項と制約項を変更することで、ADMM フレームワークを異なる $L_p$ ノルムに適応させ、最小限のコード変更で4つの攻撃タイプをサポートする同一のコアアルゴリズムを実現する。
  • モデルアーキテクチャとパラメータへの完全なアクセスを有するホワイトボックス攻撃設定を採用し、ターゲットラベルへの誤分類を保証しながら、摂動の $L_p$ ノルムを最小化する形で攻撃を定式化する。
  • モデル予測に勾配ベースのバックプロパゲーションを統合し、ADMM の反復処理によって adversarial 摂動を精緻化することで、攻撃成功率と歪み低減のバランスを取る。
  • MNIST、CIFAR-10、ImageNet に対してフレームワークを適用し、防御蒸留や adversarial training に対する頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ11 つの統一された最適化フレームワークが、深層ニューラルネットワークにおけるすべての主要な $L_p$ ノルム($L_0$、$L_1$、$L_2$、$L_\infty$)にわたって効果的に adversarial example を生成できるか。
  • RQ2C&W や EAD 攻撃といった最先端の攻撃と比較して、ADMM を用いた攻撃は、さまざまな $L_p$ ノルムにおいて歪みと成功率の両面で優れているか。
  • RQ3ADMM を用いた adversarial example が、防御蒸留や adversarial training といった防御メカニズムをどれほど破壊できるか。
  • RQ4ADMM フレームワークによって生成された adversarial example が、特に防御技術を用いたターゲットモデルへどれほど転送可能か。

主な発見

  • ADMM を用いた攻撃は、MNIST、CIFAR-10、ImageNet においてすべての $L_p$ ノルム($L_0$、$L_1$、$L_2$、$L_\infty$)で 100% の攻撃成功率を達成しており、既存手法を上回っている。
  • MNIST および CIFAR-10 では、最悪ケースにおいて ADMM 攻撃の $L_\infty$ 歪みは IFGM 攻撃よりも最大 40% 低く抑えられている。
  • ImageNet では、ADMM 攻撃の $L_\infty$ 歪みは IFGM 攻撃よりも 64% 低く抑えられており、最小歪みの面で顕著な改善が確認された。
  • 防御蒸留(温度パラメータ $T = 1, 10, 100$)で保護されたモデルに対しても、ADMM 攻撃は 100% の攻撃成功率を達成し、効果的に破壊した。
  • adversarially trained モデルに適用した場合、ADMM の $L_2$ 攻撃は、3つのテストネットワーク(未防御、C&W 例で訓練、ADMM 例で訓練)すべてで 100% の攻撃成功率を維持しており、防御モデルでは歪みが高くなる傾向にあり、防御の有効性が示された。
  • $L_2$ 攻撃において、$\kappa > 40$ の場合、ADMM で生成された例の方が C&W で生成された例よりも、$T=100$ の蒸留モデルへの転送性が高く、$\kappa=50$ 時に ASR が ADMM でほぼ 98% に達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。