Skip to main content
QUICK REVIEW

[論文レビュー] Automated Discovery of Adaptive Attacks on Adversarial Defenses

Chengyuan Yao, Pavol Bielik|arXiv (Cornell University)|Feb 23, 2021
Adversarial Robustness in Machine Learning参考文献 48被引用数 4
ひとこと要約

本稿では、再利用可能な攻撃コンポーネント(例:アルゴリズム、ネットワーク変換、損失関数)の形式化された空間を探索することで、防御固有の適応的攻撃を自動で発見する A3(Adaptive AutoAttack)という自動フレームワークを提案する。24の防御のうち10つにおいて、AutoAttackを上回り、3.0%〜50.8%の追加の adversarial 例を発見した。これは、手動作業を減らしつつ、耐性評価の信頼性を著しく向上させる。

ABSTRACT

Reliable evaluation of adversarial defenses is a challenging task, currently limited to an expert who manually crafts attacks that exploit the defense's inner workings or approaches based on an ensemble of fixed attacks, none of which may be effective for the specific defense at hand. Our key observation is that adaptive attacks are composed of reusable building blocks that can be formalized in a search space and used to automatically discover attacks for unknown defenses. We evaluated our approach on 24 adversarial defenses and show that it outperforms AutoAttack, the current state-of-the-art tool for reliable evaluation of adversarial defenses: our tool discovered significantly stronger attacks by producing 3.0\%-50.8\% additional adversarial examples for 10 models, while obtaining attacks with slightly stronger or similar strength for the remaining models.

研究の動機と目的

  • Adversarial 防御の評価が信頼性に欠ける問題に取り組むこと。これは、しばしば強力で特化した攻撃が不足しているためである。
  • 防御固有の弱みを突く適応的攻撃を設計するための、手作業で専門家が行う作業を自動化すること。
  • アルゴリズム、損失関数、ネットワーク変換などの再利用可能な攻撃コンポーネントを、自動攻撃発見を可能にする探索空間へ形式化すること。
  • 個々の防御に特化した攻撃を発見することで、Adversarial な耐性評価の信頼性と強度を向上させること。
  • 攻撃開発における試行錯誤の負担を軽減しつつ、人間の専門家が新しい攻撃タイプの開発に注力できるようにすること。

提案手法

  • 本手法は、攻撃アルゴリズム(例:PGD, APGD, FAB)、ネットワーク変換(例:BPDA, レイヤー除去)、損失関数(例:交差エントロピー、DLR、C&W)の3つのコアコンponents からなる探索空間を定義する。
  • 攻撃発見タスクを、この探索空間における最適化問題として定式化し、各設定が候補となる適応的攻撃を表す。
  • 探索は、ベイズ最適化や早期停止などの技術を活用して、有効性とコストのバランスを取るアルゴリズムによって効率的に実施される。
  • ハイパーパrameter(例:ステップサイズ、ステップ数)の動的適応が可能であり、EOT(変換の期待値)やランダマイゼーションなどの技術を統合して、攻撃成功率を向上させる。
  • Adaptive AutoAttack (A3) と名付けられたツールは、定義された空間内で最も強力な攻撃を探索することで、防御の自動テストを実現する。
  • 本アプローチは拡張性を備えている。専門家が新しい攻撃コンポーネントを追加することで、システムの再設計なしに探索空間を拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1固定アンサンブル手法(例:AutoAttack)に比べ、体系的かつ自動化されたアプローチが、より強力な適応的攻撃を発見できるか?
  • RQ2アルゴリズム、損失関数、ネットワーク変換などの再利用可能な攻撃コンポーネントを、効果的な攻撃発見を可能にする探索空間へ形式化できるか?
  • RQ3自動探索が、手作業で作成された専門家による適応的攻撃に比べ、adversarial 成功率の面でどの程度優れているか?
  • RQ4多様な Adversarial 防御機構を有する防御に対して、自動化ツールの性能はどのように比較されるか?
  • RQ5探索空間に明示的に含まれていない既知の適応的攻撃ですら、探索プロセスが再発見または改善できるか?

主な発見

  • A3 は、24の評価防御のうち10つにおいて、AutoAttack よりもはるかに強力な攻撃を発見し、3.0%〜50.8%の追加の adversarial 例を生成した。
  • 残りの14の防御についても、A3 は AutoAttack と同等またはわずかに優れた攻撃強度を達成しており、多様な防御タイプにわたる頑健性を示した。
  • 探索空間に明示的に含まれていない手作業による適応的攻撃を、ツールが成功裏に再発見または改善した。これは汎化能力の高さを示している。
  • 探索空間の設計により、動的ステップサイズ、変更された損失関数、および代替モデル変換を含む攻撃設定の有効な探索が可能になった。
  • 攻撃開発における手作業の試行錯誤の必要性が軽減され、専門家が設定チューニングの作業から解放され、新しい攻撃タイプの開発に注力できるようになった。
  • 成功を収めた一方で、探索空間は完全ではなく、実行時間のモデリングが不十分なため、高コストな攻撃は高い計算コストを伴う可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。