Skip to main content
QUICK REVIEW

[論文レビュー] Enhancing Gradient-based Attacks with Symbolic Intervals

Shiqi Wang, Yizheng Chen|arXiv (Cornell University)|Jun 5, 2019
Adversarial Robustness in Machine Learning参考文献 37被引用数 11
ひとこと要約

この論文では、入力の周囲のより広範で有望な領域を特定するために、記号的区間伝播を活用する区間攻撃という、新たな勾配ベースの手法を紹介している。音声的な上界を用いて勾配をより情報豊かに生成することで、最先端の敵対的に訓練されたモデル、特にMadryLabチャレンジにおける最良のMNISTモデルにおいて、PGDより47%高い敵対的攻撃成功率を達成している。

ABSTRACT

Recent breakthroughs in defenses against adversarial examples, like adversarial training, make the neural networks robust against various classes of attackers (e.g., first-order gradient-based attacks). However, it is an open question whether the adversarially trained networks are truly robust under unknown attacks. In this paper, we present interval attacks, a new technique to find adversarial examples to evaluate the robustness of neural networks. Interval attacks leverage symbolic interval propagation, a bound propagation technique that can exploit a broader view around the current input to locate promising areas containing adversarial instances, which in turn can be searched with existing gradient-guided attacks. We can obtain such a broader view using sound bound propagation methods to track and over-approximate the errors of the network within given input ranges. Our results show that, on state-of-the-art adversarially trained networks, interval attack can find on average 47% relatively more violations than the state-of-the-art gradient-guided PGD attack.

研究の動機と目的

  • 敵対的に訓練されたニューラルネットワークにおいて、勾配ベースの攻撃が局所最適に陥りがちな問題に対処すること。
  • 標準的な1次攻撃(例:PGD)がすべての敵対的例を発見できない場合に、敵対的に訓練されたモデルが本当に未知の攻撃に対して堅牢であるかどうかを調査すること。
  • 既存の勾配ベースの攻撃と組み合わせて、音声的な境界伝播を統合した汎用的な攻撃フレームワークを開発すること。
  • 区間攻撃の有効性を、最先端の敵対的に訓練されたモデル、特にMadryLab MNISTチャレンジのモデルを含めて評価すること。

提案手法

  • この手法は、与えられた入力摂動領域におけるニューラルネットワークの出力範囲を過剰近似する音声的な境界伝播技術(記号的区間解析)を用いる。
  • 記号的区間表現から区間勾配を抽出し、これは標準的な勾配よりも損失のランドスケープを広く捉えることができる。
  • 区間勾配は、標準的なPGDが閉じ込められがちな局所最小を避けるために、敵対的例の可能性がより高い領域へと探索を誘導する。
  • 攻撃は2段階のプロセスを実行する:まず、区間勾配を用いて有望な初期点を特定し、次に、正確な敵対的例を特定するために強力な勾配ベースの攻撃(例:PGD)を適用する。
  • 反復ごとに過剰近似誤差と探索効果のバランスを取るために、動的範囲調整戦略が採用されている。
  • このフレームワークは汎用的であり、記号的区間以外の音声的境界伝播手法に対しても応用可能である。

実験結果

リサーチクエスチョン

  • RQ1区間攻撃は、敵対的に訓練されたモデルにおいて、標準的な勾配ベースの攻撃(例:PGD)よりも敵対的例を効果的に発見できるか?
  • RQ2記号的区間伝播を用いることで、局所最適を脱出するのに役立つ、より広範かつ情報量の多い勾配が得られるか?
  • RQ3区間攻撃は、MadryLab MNISTチャレンジのモデルのような最も堅牢なモデルに対しても効果的か?
  • RQ4区間攻撃は、かつては検出されなかった、堅牢であるとされるモデルの脆弱性を明らかにできるか?
  • RQ5PGDと比較して、区間攻撃を用いた敵対的訓練の計算コストと収束特性はいかがなっているか?

主な発見

  • 3つの敵対的に訓練されたMNISTモデルにおいて、区間攻撃はPGDに比べて平均して47%多くの敵対的例を発見した。
  • MadryLab MNISTチャレンジのモデル(MNISTで最も堅牢なモデル)において、区間攻撃はすべての既存の攻撃の中で最高の成功率を達成した。
  • 区間攻撃の損失分布は、多数の明確で高価値の違反を示しており、PGDやCW攻撃は低損失で容易に発見可能な例に集中していた。
  • MNIST_FC1およびMNIST_FC2では、20イタレーションで区間攻撃はPGDに比べて攻撃成功率が38%から61%まで相対的に向上した。
  • 区間攻撃を用いた敵対的訓練は、PGDベースの訓練よりも著しく遅く、効率が悪く、小さなMNISTネットワークで80%の堅牢性に到達するまでに47倍の時間がかかった。
  • 結果として、PGDが究極の1次攻撃ではないことが示され、音声的な境界伝播が、隠れた敵対的領域を明らかにすることで敵対的探索を顕著に改善できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。