Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Attack Generation Empowered by Min-Max Optimization

Jingkang Wang, Tianyun Zhang|arXiv (Cornell University)|Jun 9, 2019
Adversarial Robustness in Machine Learning参考文献 66被引用数 10
ひとこと要約

本稿では、モデルアンサンブル、ユニバーサルノイズ、データ変換に対するロバストな攻撃を含む複数の分野にまたがる敵対的攻撃生成を統一的かつ改善するミニマックス最適化フレームワークを提案する。最悪ケース攻撃損失の最小化を、確率単体上に制約されたドメイン重みに関するミニマックス問題として定式化することで、PGDに対してCIFAR-10で17.48%、35.21%、9.39%の向上を達成する。同時に、自己説明可能なドメイン重要度重み付けを可能にする。

ABSTRACT

The worst-case training principle that minimizes the maximal adversarial loss, also known as adversarial training (AT), has shown to be a state-of-the-art approach for enhancing adversarial robustness. Nevertheless, min-max optimization beyond the purpose of AT has not been rigorously explored in the adversarial context. In this paper, we show how a general framework of min-max optimization over multiple domains can be leveraged to advance the design of different types of adversarial attacks. In particular, given a set of risk sources, minimizing the worst-case attack loss can be reformulated as a min-max problem by introducing domain weights that are maximized over the probability simplex of the domain set. We showcase this unified framework in three attack generation problems -- attacking model ensembles, devising universal perturbation under multiple inputs, and crafting attacks resilient to data transformations. Extensive experiments demonstrate that our approach leads to substantial attack improvement over the existing heuristic strategies as well as robustness improvement over state-of-the-art defense methods trained to be robust against multiple perturbation types. Furthermore, we find that the self-adjusted domain weights learned from our min-max framework can provide a holistic tool to explain the difficulty level of attack across domains. Code is available at https://github.com/wangjksjtu/minmax-adv.

研究の動機と目的

  • 敵対的訓練を超えた分野における体系的なミニマックス最適化の欠如に取り組む。
  • モデルアンサンブル攻撃、ユニバーサルノイズ、変換に耐性のある攻撃といった多様な攻撃タイプを、1つのミニマックス最適化フレームワークで統一する。
  • 攻撃性能を低下させるヒューリスティックな重み付け戦略(例:均等平均)を克服する。
  • 異なるドメインの攻撃の相対的な難易度を反映する解釈可能なドメイン重みを提供する。
  • 複数のノイズタイプを想定した一般化敵対的訓練を含む防御への応用を拡張する。

提案手法

  • 最悪ケース攻撃損失の最小化を、確率単体上に制約されたドメイン重みに関するミニマックス問題として定式化する。
  • 効率的なミニマックス問題の解法として、交互に1ステップの投影勾配降下上昇(APGDA)アルゴリズムを導入する。
  • 攻撃生成中にエンドツーエンドでドメイン重みを学習し、モデルが最も困難なドメインを自己特定できるようにする。
  • 3つの攻撃タイプにフレームワークを適用する:モデルアンサンブルの攻撃、複数の入力にわたるユニバーサルノイズの生成、データ変換に耐性のある攻撃の設計。
  • ドメイン重みメカニズムを一般化敵対的訓練に応用し、複数のノイズタイプに対する耐性を向上させる。
  • 理論的収束解析により、APGDAの収束速度がO(1/T)であることが示され、Tは反復回数を表す。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練を超えた分野において、ミニマックス最適化を効果的に活用することで、敵対的攻撃生成を改善できるか?
  • RQ2モデルアンサンブル、ユニバーサルノイズ、変換に耐性のある攻撃といった多様な敵対的攻撃設定を統一的に扱えるフレームワークをどのように設計できるか?
  • RQ3学習可能なドメイン重みは、異なるドメインの攻撃難易度に関する解釈可能なインサイトを提供できるか?
  • RQ4提案されたミニマックスフレームワークは、マルチドメイン攻撃シナリオにおいて、ヒューリスティックな重み付け戦略を上回る性能を示すか?
  • RQ5ドメイン重みメカニズムは、一般化敵対的訓練の向上および防御の耐性強化に応用可能か?

主な発見

  • 提案されたAPGDA手法は、CIFAR-10におけるモデルアンサンブル攻撃において、標準的なPGDに比べ17.48%高い攻撃成功率を達成した。
  • 複数の画像にわたるユニバーサルノイズ攻撃では、ベースラインのPGDに比べ35.21%の攻撃成功率向上を達成した。
  • データ変換に耐性のある攻撃では、従来のPGDに比べ9.39%の攻撃成功率向上を達成した。
  • 学習されたドメイン重みは、攻撃の難易度を正確に反映しており、よりロバストまたは攻撃が難しい画像に対して高い重みが割り当てられている。
  • 一般化敵対的訓練に適応した場合、複数のノイズタイプに対する最先端の防御を上回る優れた防御性能を発揮した。
  • 可視化により、ドメイン重みが異なるノルムのノイズに対して、画像のロバストネスを包括的かつ解釈可能な指標として提供することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。