Skip to main content
QUICK REVIEW

[論文レビュー] Thundernna: a white box adversarial attack

Linfeng Ye, Hamidi, Shayan Mohajer|arXiv (Cornell University)|Nov 24, 2021
Adversarial Robustness in Machine Learning参考文献 3被引用数 4
ひとこと要約

Thundernnaは、1ステップの効率を維持しながらFGSMを上回る高い成功確率を達成する、新しい1次白ボックス攻撃を提案する。これは、1次および2次手法と比較して速度で優れる。凸化された損失積分と勾配ベースのノイズ最適化を活用し、最小限の計算オーバーヘッドで効果的な adversarial examples を生成する。

ABSTRACT

The existing work shows that the neural network trained by naive gradient-based optimization method is prone to adversarial attacks, adds small malicious on the ordinary input is enough to make the neural network wrong. At the same time, the attack against a neural network is the key to improving its robustness. The training against adversarial examples can make neural networks resist some kinds of adversarial attacks. At the same time, the adversarial attack against a neural network can also reveal some characteristics of the neural network, a complex high-dimensional non-linear function, as discussed in previous work. In This project, we develop a first-order method to attack the neural network. Compare with other first-order attacks, our method has a much higher success rate. Furthermore, it is much faster than second-order attacks and multi-steps first-order attacks.

研究の動機と目的

  • 既存の1次手法を上回る高速で高精度な白ボックス攻撃を開発すること。
  • adversarial example生成における攻撃成功確率と計算効率のトレードオフを解消すること。
  • 勾配ベースの摂動生成の安定性と向上を図るため、凸化された負の対数尤度損失関数の利用を検討すること。
  • 繰り返しの最適化を避けることで、1ステップの高速性を保ちつつ効率的な攻撃生成を可能にすること。
  • さまざまな摂動予算における摂動の頑健性と一般化性能を調査すること。

提案手法

  • Negative log-likelihood (NLL) 損失とソフトマックスを用いた最適化問題として攻撃を定式化し、その定義域上で凸積分を示す。
  • 入力画像に関するNLL損失の勾配の逆数として、adversarial noiseの閉形式表現を導出する。
  • 入力画素が独立していると仮定し、勾配分母をすべて1の行列として近似することで、ノイズ計算を 1 / (∂NLL_loss / ∂image) に簡略化する。
  • TVMフレームワークを用いて前向きおよび後ろ向き伝搬を高速化し、実行時間の効率を向上させる。
  • 繰り返しの最適化を回避することで、1ステップ法としての高速性を維持しながら高い成功確率を達成する。
  • データに依存しない設計となっており、異なる入力およびタスク間での転送性を実現する。

実験結果

リサーチクエスチョン

  • RQ11ステップの1次攻撃は、FGSMを上回る高い成功確率を達成しつつ、優れた速度を維持できるか?
  • RQ2凸化された損失関数は、より安定的かつ効果的な勾配ベースのadversarial noise生成を可能にするか?
  • RQ3摂動予算が増加するにつれてThundernnaの成功確率はどのように変化するか?また、なぜ高予算では低下するのか?
  • RQ4反復的でない1ステップ法は、PGD や2次攻撃といった反復的アプローチを速度と成功確率の両面で上回れるか?
  • RQ5この凸損失に基づく勾配法によって生成されたadversarial perturbationsの内在的特性は何か?

主な発見

  • Thundernnaは、0.1から0.5までの全テスト摂動予算で、FGSMを上回る高い攻撃成功確率を達成し、優れた有効性を示した。
  • 1枚あたり0.19秒で50枚の画像に対してadversarial examplesを生成し、PGD(0.909秒/50枚)および2次攻撃(0.955秒/50枚)を上回る速度を達成した。
  • 1ステップ法であるにもかかわらず、Thundernnaの成功確率はFGSMを上回り、一部の多段階手法と同等またはそれを上回る効率性と正確性を示した。
  • 摂動予算が増加するにつれて攻撃成功確率が低下するという、直感に反する結果が得られ、さらなる調査が求められる。
  • ResNet-18を用いたImageNet-2012上での実験により、この手法の頑健性と一般化性能が確認され、標準ベンチマーク上での妥当性が裏付けられた。
  • 理論的仮定である勾配分母をすべて1の行列として近似できるという仮定が、実験的にも正当化された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。