Skip to main content
QUICK REVIEW

[論文レビュー] Playing it Safe: Adversarial Robustness with an Abstain Option

Cassidy Laidlaw, Soheil Feizi|arXiv (Cornell University)|Nov 25, 2019
Adversarial Robustness in Machine Learning参考文献 28被引用数 8
ひとこと要約

本稿では、分類器と入力空間内の予測を控える領域を同時に学習する手法であるCombined Abstention Robustness Learning (CARL) を提案する。CARLは不確実性を意識した控えの学習により、MNIST においてベースラインと比較して敵対的誤差を50%以上削減しながら自然な精度を維持することで、敵対的耐性と推論効率の両方を向上させる。

ABSTRACT

We explore adversarial robustness in the setting in which it is acceptable for a classifier to abstain---that is, output no class---on adversarial examples. Adversarial examples are small perturbations of normal inputs to a classifier that cause the classifier to give incorrect output; they present security and safety challenges for machine learning systems. In many safety-critical applications, it is less costly for a classifier to abstain on adversarial examples than to give incorrect output for them. We first introduce a novel objective function for adversarial robustness with an abstain option which characterizes an explicit tradeoff between robustness and accuracy. We then present a simple baseline in which an adversarially-trained classifier abstains on all inputs within a certain distance of the decision boundary, which we theoretically and experimentally evaluate. Finally, we propose Combined Abstention Robustness Learning (CARL), a method for jointly learning a classifier and the region of the input space on which it should abstain. We explore different variations of the PGD and DeepFool adversarial attacks on CARL in the abstain setting. Evaluating against these attacks, we demonstrate that training with CARL results in a more accurate, robust, and efficient classifier than the baseline.

研究の動機と目的

  • 誤った予測が危険な安全上の重要な応用分野における敵対的耐性の課題に対処すること。
  • 分類器が敵対的入力に対して誤分類するのではなく、予測を控えるという新しいパラダイムを検討すること。
  • 分類と控え領域の両方を最適化する共同学習フレームワークを開発し、耐性と効率の向上を図ること。
  • 控えが敵対的例以外の自然な入力や分布外入力に対しても、モデルの不確実性の信頼できる指標として機能するかどうかを評価すること。

提案手法

  • 自然な精度と敵対的耐性のトレードオフを明示的にモデル化する新しい目的関数を提案する。
  • PGD および DeepFool をベースにした6つの新しい敵対的攻撃変種を導入し、分類器を誤った予測に誘導するが、控えを避ける例を生成する。
  • 具体的には ℓ_abstain および ℓ_interp の2つの代替損失関数を用いて、モデルが敵対的入力に対して正しく予測するか、あるいは控えるように学習する。
  • PGD 攻撃で段階的に減少するステップサイズを採用し、正解領域と控え領域の間の小さなギャップを効果的に探索することで、訓練中の攻撃効果を高める。
  • 1つのニューラルネットワークを用いて、分類器と控え領域を同時に学習し、推論時に意思決定境界までの距離を計算する高コストな処理を回避する。
  • 訓練中に複数の損失関数からランダムにサンプリングすることで、多様な敵対的例に対して一般化性と耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1敵対的入力に対して予測を控えることを許容することで、分類器の耐性を向上させることができるか?
  • RQ2自然な精度と敵対的耐性のトレードオフを明示的にモデル化・最適化する方法は何か?
  • RQ3分類器と控え領域の共同学習は、ヒューリスティックな控え戦略と比較して、耐性と推論効率の両面で向上をもたらすか?
  • RQ4CARL によって学習された控え行動は、自然な入力や分布外入力に対しても不確実性の信頼できる指標として機能するか?

主な発見

  • CARL は、ベースライン手法と比較して MNIST で敵対的誤差を50%以上削減しながら、自然誤差率は同一のまま維持する。
  • CIFAR-10 では、CARL で学習されたモデルがベースラインのパレートフロンティアを上回り、より優れた精度-耐性トレードオフを達成する。
  • CIFAR-10 では、CARL の分類器が自然入力の30%に対して控えを行い、その結果、誤った予測はたった1.8%にとどまる。これは強い不確実性認識を示している。
  • CARL で学習されたモデルは、純粋なノイズ入力に対しても控えを行う。これは過信の低下と分布シフトに対する耐性の向上を示している。
  • 訓練時に使用する代替損失関数(ℓ_abstain と ℓ_interp)の選択が最終誤差率にほとんど影響しないことから、損失関数の選択に対して頑健であることが示された。
  • 意思決定境界までの距離をテスト時に計算する必要がないため、ベースラインと比較して効率的な推論が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。