Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Training Should Be Cast as a Non-Zero-Sum Game

Alexander Robey, Fabian Latorre|arXiv (Cornell University)|Jun 19, 2023
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿は、防御者が分類誤差の上界を最小化し、攻撃者が0-1損失の連続的再定式化を最大化する非ゼロ和バイレベル定式化を提案する。この結果得られるBETA-ATアルゴリズムは、ヒューリスティクスを用いずCIFAR-10で最先端のロバスト性を達成し、ロバスト性保証を無効にする surrogate に基づく緩和を避けることでロバスト過学習を解消する。

ABSTRACT

One prominent approach toward resolving the adversarial vulnerability of deep neural networks is the two-player zero-sum paradigm of adversarial training, in which predictors are trained against adversarially chosen perturbations of data. Despite the promise of this approach, algorithms based on this paradigm have not engendered sufficient levels of robustness and suffer from pathological behavior like robust overfitting. To understand this shortcoming, we first show that the commonly used surrogate-based relaxation used in adversarial training algorithms voids all guarantees on the robustness of trained classifiers. The identification of this pitfall informs a novel non-zero-sum bilevel formulation of adversarial training, wherein each player optimizes a different objective function. Our formulation yields a simple algorithmic framework that matches and in some cases outperforms state-of-the-art attacks, attains comparable levels of robustness to standard adversarial training algorithms, and does not suffer from robust overfitting.

研究の動機と目的

  • 標準の surrogate に基づく adversarial training における根本的な欠陥を特定すること。これは、0-1損失の不適切な緩和によりロバスト性保証が無効になるためである。
  • 防御者と攻撃者が別々の目的関数を最適化する非ゼロ和バイレベルゲームとして adversarial training を再定式化し、ロバスト性保証を維持すること。
  • ヒューリスティクスを一切用いない adversarial training アルゴリズム(BETA-AT)を開発し、CIFAR-10で最先端のロバスト性を達成または上回ること。
  • ロバスト過学習が surrogate に基づくゼロ和定式化の結果であるにすぎず、ロバスト一般化の根本的制限ではないことを示すこと。
  • 適切に定式化された adversarial 目的関数により、複雑な攻撃ヒューリスティクス(複数回の再起動や適応的学習率など)を用いずに正確なロバスト性推定が可能であることを示すこと。

提案手法

  • 防御者が0-1分類誤差の上界を最小化し、攻撃者が同誤差の連続的緩和を最大化するバイレベル最適化定式化を導出する。
  • 攻撃者の目的関数として0-1損失の連続的再定式化を用い、それを最大化することが真の adversarial 例の探索に対応することを保証する。
  • 攻撃者の目的関数に基づく新しい攻撃アルゴリズム BETA(BEst Adversarial Attack)を提案し、ヒューリスティクスを用いずに正確なロバスト性を推定可能であることを実証する。
  • バイレベル定式化に基づく訓練アルゴリズム BETA-AT を開発し、surrogate に基づく緩和を避けており、複数回の再起動や適応的学習率といった臨戦的技術を必要としない。
  • 標準的な一次順序最適化を用いて実装し、複雑なハイパーパramータチューニングなしに実用的かつ容易に展開可能であることを示す。
  • モデル選択に早期停止を用い、BETA-AT がヒューリスティクスの停止条件を必要とせず、強力なロバスト性を維持することを示す。

実験結果

リサーチクエスチョン

  • RQ1標準的な adversarial training における surrogate 損失の使用が、攻撃者の強度を弱めるためにロバスト性保証を無効にしているか?
  • RQ2adversarial training を非ゼロ和バイレベル定式化として再定式化することで、ロバスト性保証を維持しながらも実行可能であるか?
  • RQ3adversarial training における surrogate に基づく緩和を排除することで、ロバスト過学習が誤った最適化の結果であるというアーティファクトとして解消されるか?
  • RQ4適切に定式化された adversarial 目的関数により、複雑なヒューリスティクスを用いずに AutoAttack と同等のロバスト性を達成できるか?
  • RQ5提案されたバイレベルフレームワークは、標準的な adversarial training を超えて、他の分布シフト設定にも一般化可能か?

主な発見

  • adversarial training で一般的に用いられる surrogate に基づく緩和は、すべてのロバスト性保証を無効にし、弱い攻撃者と効果のない訓練をもたらす。
  • 提案されたバイレベル非ゼロ和定式化により、攻撃者の目的関数を最大化することが真の最適 adversarial 例の探索に対応し、ロバスト性保証が維持される。
  • BETA-AT は、複数回の再起動や適応的学習率といったヒューリスティクスを用いず、CIFAR-10 で最先端の手法(例:AutoAttack)と同等またはそれ以上のテストロバスト性を達成する。
  • このアルゴリズムはロバスト過学習を完全に解消し、これは不適切な surrogate 緩和の結果であるにすぎず、精度とロバスト性の根本的トレードオフではないことを示唆する。
  • BETA は AutoAttack とほぼ同一のロバスト性推定を提供し、目的関数が正しく整合されていれば、複雑な攻撃ヒューリスティクスを用いずに正確なロバスト性評価が可能であることを実証する。
  • バイレベル定式化は一般化可能であり、将来的なロバスト機械学習研究のための原理的基盤を提供する。収束性やサンプル複雑度の分析も含む。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。