Skip to main content
QUICK REVIEW

[論文レビュー] Yet another but more efficient black-box adversarial attack: tiling and evolution strategies

Laurent Meunier, Jamal Atif|arXiv (Cornell University)|Oct 5, 2019
Adversarial Robustness in Machine Learning参考文献 45被引用数 20
ひとこと要約

本稿では、$ε$-ボール制約付きの攻撃に特化した新しい目的関数を備えた勾配フリー最適化(DFO)を用いたブラックボックス敵対的攻撃フレームワークを提案する。タイリング戦略とCMA-ESなどの高度な進化戦略を組み合わせることで、非指向攻撃では最大90クエリ、指向攻撃では800クエリのクエリ予算を削減し、InceptionV3に対して平均630クエリで99.2%の成功率を達成するという最先端の性能を実現した。

ABSTRACT

We introduce a new black-box attack achieving state of the art performances. Our approach is based on a new objective function, borrowing ideas from $\ell_\infty$-white box attacks, and particularly designed to fit derivative-free optimization requirements. It only requires to have access to the logits of the classifier without any other information which is a more realistic scenario. Not only we introduce a new objective function, we extend previous works on black box adversarial attacks to a larger spectrum of evolution strategies and other derivative-free optimization methods. We also highlight a new intriguing property that deep neural networks are not robust to single shot tiled attacks. Our models achieve, with a budget limited to $10,000$ queries, results up to $99.2\%$ of success rate against InceptionV3 classifier with $630$ queries to the network on average in the untargeted attacks setting, which is an improvement by $90$ queries of the current state of the art. In the targeted setting, we are able to reach, with a limited budget of $100,000$, $100\%$ of success rate with a budget of $6,662$ queries on average, i.e. we need $800$ queries less than the current state of the art.

研究の動機と目的

  • 既存の手法よりもクエリ数を削減できる、より効率的なブラックボックス敵対的攻撃の開発。
  • 勾配やモデルアーキテクチャが入手できない状況下で、ロジットのみが利用可能なブラックボックス攻撃の課題に対処すること。
  • 敵対的攻撃生成における勾配フリー最適化(DFO)手法の性能を調査・最適化すること。
  • 深層ニューラルネットワークがシングルショットタイリング攻撃に対してどれほど頑健でないかを調査し、これまでに観察されていなかった脆弱性を明らかにすること。
  • 強力な防御基準としての敵対的訓練を施したモデルに対する、提案手法の有効性を評価すること。

提案手法

  • 勾配フリー最適化に特化した新しい目的関数を提案。$ε$-制約付き$∞$-ノルムホワイトボックス攻撃をインspirationとしている。
  • 摂動空間をより小さな管理可能なタイルに分割するタイリング戦略を導入。これにより、探索効率と成功確率が向上する。
  • Nevergradフレームワーク内に、CMA-ES、DiagonalCMA、Cauchy (1+1)-ES、および離散最適化を含む多様なDFO手法を適用。
  • 連続的($\mathrm{DFO}_c$)および離散的($\mathrm{DFO}_d$)な最適化問題の定式化を用いて、異なる探索空間を調査。
  • 摂動ノルム($\epsilon = 0.05$)とクエリ予算制限を制御した非指向および指向の両設定で攻撃を適用。
  • 進化戦略における初期のクエリはしばしばランダムに近いため、タイリングにより早期成功の確率が向上することを活用。

実験結果

リサーチクエスチョン

  • RQ1新しい目的関数を備えた勾配フリー最適化アプローチは、クエリ効率の面で既存のブラックボックス攻撃を上回ることができるか?
  • RQ2タイリング戦略は、ブラックボックス敵対的攻撃における成功確率の向上とクエリ数の削減にどのように寄与するか?
  • RQ3なぜ深層ニューラルネットワークはシングルショットタイリング攻撃に対して脆弱であるのか?これはその頑健性に関する新たな理解を示唆するか?
  • RQ4提案手法は、強力な防御基準としての敵対的訓練を施したモデルに対しても効果的か?
  • RQ5CMA-ESやCauchy (1+1)-ESなどのDFO手法の中で、ブラックボックス敵対的攻撃に最も効果的なのはどれか?その理由は何か?

主な発見

  • 提案手法は、InceptionV3に対する非指向攻撃で平均630クエリで99.2%の成功率を達成。これは、従来の最先端手法と比較してクエリ予算を90削減した。
  • 指向攻撃では、平均6,662クエリで100%の成功率に到達。10万クエリの予算下で、現在の最先端手法と比較して800クエリ少ない。
  • CMA-ESとDiagonalCMAが他のDFO手法を上回り、指向および非指向両設定で全指標で最高の結果を達成した。
  • タイリング戦略は早期成功確率を顕著に向上させ、特に非指向攻撃において中央値と平均クエリ数が低いことからも明らかである。
  • 敵対的訓練を施したモデルに対しても、本手法は有効であるが、CIFAR-10で防御されたWideResNetに対しては、パーサモンアタックがわずかに優れている。
  • 本研究では、これまでに観察されていなかった脆弱性が明らかになった:深層ニューラルネットワークはシングルショットタイリング攻撃に対して頑健でない。これは、現在の頑健性理解における重要なギャップを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。