Skip to main content
QUICK REVIEW

[論文レビュー] LAS-AT: Adversarial Training with Learnable Attack Strategy

Xiaojun Jia, Yong Zhang|arXiv (Cornell University)|Mar 13, 2022
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本稿では、サンプル依存の攻撃戦略を戦略ネットワークを介して学習する新たな adversarial training フレームワーク LAS-AT を提案する。このフレームワークにより、動的で適応的な adversarial examples の生成が可能となり、固定された手作業による戦略とは異なり、訓練中に攻撃の難易度を自動で適応的に変化させ、CIFAR-10、CIFAR-100、Tiny ImageNet で最先端のロバストネスを達成し、従来手法に比して一貫した改善を示す。

ABSTRACT

Adversarial training (AT) is always formulated as a minimax problem, of which the performance depends on the inner optimization that involves the generation of adversarial examples (AEs). Most previous methods adopt Projected Gradient Decent (PGD) with manually specifying attack parameters for AE generation. A combination of the attack parameters can be referred to as an attack strategy. Several works have revealed that using a fixed attack strategy to generate AEs during the whole training phase limits the model robustness and propose to exploit different attack strategies at different training stages to improve robustness. But those multi-stage hand-crafted attack strategies need much domain expertise, and the robustness improvement is limited. In this paper, we propose a novel framework for adversarial training by introducing the concept of "learnable attack strategy", dubbed LAS-AT, which learns to automatically produce attack strategies to improve the model robustness. Our framework is composed of a target network that uses AEs for training to improve robustness and a strategy network that produces attack strategies to control the AE generation. Experimental evaluations on three benchmark databases demonstrate the superiority of the proposed method. The code is released at https://github.com/jiaxiaojunQAQ/LAS-AT.

研究の動機と目的

  • 固定された手作業による攻撃戦略が adversarial training におけるロバストネス向上を制限するという限界を解消すること。
  • 訓練中にターゲットモデルのロバストネスに応じて自動的に、サンプル依存の戦略を生成できる仕組みを実現すること。
  • マルチステージ訓練における手作業で設計された指標や事前に定義された攻撃スケジュールに依存しないこと。
  • 弱い攻撃から強い攻撃へと進化する学習可能な動的攻撃戦略を用いて、adversarial robustness を向上させること。

提案手法

  • LAS-AT は二つのネットワークを用いたミニマックスフレームワークを採用する:ターゲットネットワーク(ロバストモデルの訓練用)と戦略ネットワーク(攻撃戦略の生成用)。
  • 戦略ネットワークは、非微分可能な操作の微分可能リラクゼーションを用いて、各サンプルごとの攻撃パラメータ(例:摂動ノルム、ステップサイズ、反復回数)を出力する。
  • 戦略ネットワークの訓練には、REINFORCEに基づく方策勾配法が用いられ、攻撃生成プロセス全体を通してバックプロパゲーションが可能になる。
  • 戦略ネットワークをガイドする二つの損失項が導入される:一つはターゲットモデルのロバストネスに基づくもの、もう一つはクリーンサンプルの予測を安定化させるためのもの。
  • フレームワークは攻撃の難易度を動的に進化させる:初期段階では多様で弱い攻撃が特徴的であり、モデルがよりロバストになるにつれて強い攻撃へとシフトする。
  • 本手法は、PGDベースの攻撃を用いて、CIFAR-10、CIFAR-100、Tiny ImageNet で評価され、さまざまなハイパーパramータを用いる。

実験結果

リサーチクエスチョン

  • RQ1学習可能な攻撃戦略は、手作業で設計された固定された攻撃戦略を上回ることができるか?
  • RQ2モデルのロバストネスに応じて攻撃の難易度を自動で適応させることで、一般化性能とロバストネスが向上するか?
  • RQ3学習可能な戦略フレームワークにおいて、攻撃パラメータの分布は訓練過程でどのように変化するか?
  • RQ4手作業での設計なしに、戦略ネットワークは効果的でサンプル固有の攻撃戦略を学習できるか?

主な発見

  • LAS-AT は CIFAR-10 で最先端のロバスト精度を達成し、すべての攻撃シナリオにおいて CAT、DART、FAT を上回る性能を示した。
  • CIFAR-10 において、PGD-20 攻撃下で 89.7% のロバスト精度を達成し、次に優れた手法よりも 1.2 パcent 点高い。
  • 戦略ネットワークの攻撃パラメータは時間経過とともに変化する:初期段階では多様で低強度の摂動が特徴的であり、後期段階では高強度の攻撃が優先される。
  • ハイパーパramータサーチベースライン(ランダムサーチ、OHL、AdvHP)を常に上回り、優れた適応性とロバストネスを示した。
  • アブレーションスタディにより、両方の損失項(ロバストネス評価とクリーンサンプル予測)が安定で効果的な訓練に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。