Skip to main content
QUICK REVIEW

[論文レビュー] Why adversarial training can hurt robust accuracy

Jacob Clarysse, Julia Hörmann|arXiv (Cornell University)|Mar 3, 2022
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

この論文は、特にマスキングや汚損などの指向的攻撃において、非信号特徴への過剰適合によって、小データ設定下で adversarial training が頑健一般化を劣化させることを示している。理論的に証明し、実験的に検証したところ、データが限られた状況では adversarial training が標準学習よりも頑健誤差を増加させることを明らかにした。これは、adversarial training が普遍的に頑健性を向上させるという一般的な信念に反する。

ABSTRACT

Machine learning classifiers with high test accuracy often perform poorly under adversarial attacks. It is commonly believed that adversarial training alleviates this issue. In this paper, we demonstrate that, surprisingly, the opposite may be true -- Even though adversarial training helps when enough data is available, it may hurt robust generalization in the small sample size regime. We first prove this phenomenon for a high-dimensional linear classification setting with noiseless observations. Our proof provides explanatory insights that may also transfer to feature learning models. Further, we observe in experiments on standard image datasets that the same behavior occurs for perceptible attacks that effectively reduce class information such as mask attacks and object corruptions.

研究の動機と目的

  • adversarial training が低データ設定下で頑健一般化を低下させる理由を調査すること。
  • adversarial training が普遍的に頑健性を向上させるという広く共有されている信念に挑戦すること。
  • 分類信号を低下させる指向的攻撃(例:マスキングや汚損)における adversarial training の失敗を分析すること。
  • 小標本設定下での頑健誤差の増加について理論的および実験的証拠を提供すること。
  • adversarial training が特徴の過剰適合によって頑健精度を劣化させるメカニズムを説明すること。

提案手法

  • ノイズのない観測値を持つ高次元線形分類器の理論的分析により、adversarial training における摂動予算の増加に伴い、頑健誤差が単調に増加することを証明する。
  • adversarial training と標準学習の間の頑健誤差ギャップに対する、高確率かつ非漸近的な下限を導出する。
  • CIFAR-10、Waterbirds、およびハンドジェスチャーデータセットを用いた実験的評価。目に見える攻撃(例:スクエアマスク摂動、モーションブラー)を適用。
  • 訓練および推論時に最適なブラックマスク adversarial 摂動を特定するためのグリッドサーチの使用。
  • ロジスティック回帰の重みを可視化し、adversarially trained モデルが背景ノイズにより強く依存していることを示す。
  • 小データ実験における正確なデータ表現を保証するため、不適切にクロップされた画像を手動で修正した。

実験結果

リサーチクエスチョン

  • RQ1adversarial training は、すべてのデータ設定で一貫して頑健精度を向上させるのか?
  • RQ2なぜ adversarial training は小標本設定下で頑健に一般化できないのか?
  • RQ3分類信号を低下させる指向的攻撃が、adversarially trained モデルの性能にどのように影響するのか?
  • RQ4adversarial training が頑健誤差を減少させるのではなく増加させる原因は何なのか?
  • RQ5adversarially trained モデルがデータ内の非信号特徴にどれほど過剰適合するのか?

主な発見

  • 小標本設定下では、adversarial training が大規模データ設定下で頑健性を向上させるのとは対照的に、標準学習よりも頑健誤差が増加することが判明した。
  • 分離可能なデータを持つ高次元線形モデルにおいて、adversarial training における摂動予算の増加に伴い、頑健誤差が単調に増加することが示された。
  • CIFAR-10 および Waterbirds における実験結果から、データがサブサンプリングされた場合、特にマスク攻撃や汚損攻撃において、adversarial training での頑健誤差が高くなった。
  • adversarially trained ロジスティック回帰モデルの重みベクトルには、背景ノイズが顕著に強く現れており、非信号領域への過剰適合が示された。
  • adversarial training による分類器は、無関係な画像領域(例:背景)に高い重みを割り当てており、一般化性能が低下している。
  • 最適摂動を求めるための完全なグリッドサーチを行っても、adversarial training は頑健性を向上させず、小規模データセットでは性能が劣化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。