Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting Excessive Invariance caused by Norm-Bounded Adversarial Robustness

Jörn-Henrik Jacobsen, Jens Behrmann|arXiv (Cornell University)|Mar 25, 2019
Adversarial Robustness in Machine Learning参考文献 25被引用数 19
ひとこと要約

この論文は、ℓp-ノルムに基づく摂動に対する頑健性を向上させるために深層ニューラルネットワークを訓練することは、意味的コンテンツを変化させるが予測を保持する入力(不変性に基づく敵対的例)に対して脆弱性を増大させることを示している。著者らは、この過剰な不変性を利用したモデルに依存しない攻撃を提案し、最先端の頑健モデルが不変性に基づく敵対的例のうちたった38%で人間のラベルと一致することを示している。これはベースライン性能よりも顕著に低い値である。

ABSTRACT

Adversarial examples are malicious inputs crafted to cause a model to misclassify them. Their most common instantiation, "perturbation-based" adversarial examples introduce changes to the input that leave its true label unchanged, yet result in a different model prediction. Conversely, "invariance-based" adversarial examples insert changes to the input that leave the model's prediction unaffected despite the underlying input's label having changed. In this paper, we demonstrate that robustness to perturbation-based adversarial examples is not only insufficient for general robustness, but worse, it can also increase vulnerability of the model to invariance-based adversarial examples. In addition to analytical constructions, we empirically study vision classifiers with state-of-the-art robustness to perturbation-based adversaries constrained by an $\ell_p$ norm. We mount attacks that exploit excessive model invariance in directions relevant to the task, which are able to find adversarial examples within the $\ell_p$ ball. In fact, we find that classifiers trained to be $\ell_p$-norm robust are more vulnerable to invariance-based adversarial examples than their undefended counterparts. Excessive invariance is not limited to models trained to be robust to perturbation-based $\ell_p$-norm adversaries. In fact, we argue that the term adversarial example is used to capture a series of model limitations, some of which may not have been discovered yet. Accordingly, we call for a set of precise definitions that taxonomize and address each of these shortcomings in learning.

研究の動機と目的

  • 摂動に基づく敵対的例に対する頑健性が、不変性に基づく敵対的例に対する脆弱性を増大させるかどうかを調査すること。
  • ℓp-頑健なモデルにおける過剰な不変性が、一般化性能と人間中心の意思決定を損なうことを示すこと。
  • ℓp-ボール内に不変性に基づく敵対的例を生成するモデルに依存しない攻撃を提案・評価すること。
  • 摂動に基づく攻撃に対する頑健性が一般の頑健性を示すものであるという仮定に疑問を呈し、敵対的失敗モードの分類法を提唱すること。

提案手法

  • ℓp-摂動に基づく攻撃に対して頑健だが、不変性に基づく攻撃では失敗する解析的モデルを構築し、感度と不変性のトレードオフを実証する。
  • 入力を意味的に意味のある方法で変更しながらℓp-ボール内に留まるように、ℓ0およびℓ∞の不変性に基づく敵対的例を生成するモデルに依存しない攻撃を設計する。
  • アルゴリズム的ラベルが曖昧な場合に備え、人間によるラベルをオракルとして用いて敵対的例におけるモデルの一致度を評価する。
  • 不変性に基づく攻撃に対して、最先端のℓp-頑健な視覚分類器を訓練・評価し、人間とモデルの一致度を頑健性の代理指標として測定する。
  • ℓp-ノルム制約下での意思決定境界の幾何学的性質を分析し、ℓp-ノルムが意味的またはタスク関連の変化を捉えられていないことを示す。
  • 不変性に基づく頑健性は摂動に基づく頑健性とは別個に評価すべきであり、新しい指標やアーキテクチャ設計(例:可逆ネットワーク)による不変性の制御を提唱する。

実験結果

リサーチクエスチョン

  • RQ1ℓp-摂動に基づく敵対的例に対する頑健性が、意味的に意味のある入力変化に対する感度を低下させ、不変性を増大させるか?
  • RQ2ℓp-頑健に訓練されたモデルに対して、ℓp-ボール内に不変性に基づく敵対的例を構築可能か?また、その有効性はいかほどか?
  • RQ3ℓp-頑健モデルは、不変性に基づく敵対的例において、ベースラインモデルと比較して人間ラベルとどの程度一致するか?
  • RQ4過剰な不変性を促進するアーキテクチャ的または訓練的要因は存在するか?また、それらは緩和可能か?
  • RQ5摂動に基づく例と不変性に基づく例の和集合は、すべての回避攻撃ベクトルを十分にカバーしているか?それ以外の失敗モードは存在するか?

主な発見

  • ℓp-摂動に基づく敵対的例に対して頑健に訓練されたモデルは、不変性に基づく敵対的例において人間のラベルとの一致度が著しく低下しており、ℓ0攻撃では38%にとどまる一方、ベースラインモデルでは54%であった。
  • ℓ0の不変性に基づく攻撃は55%のケースで成功したが、ℓ∞攻撃は21%のケースで成功した。両者ともそれぞれの防御のℓp-ボール内に収束していた。
  • 成功した不変性に基づく敵対的例において、ℓp-頑健モデルはℓ0攻撃では58%未満、ℓ∞攻撃では5%未満の一致度を示した。
  • 研究では、一部のクラスペアが他のクラスペアよりも不変性に基づく攻撃に対してより脆弱であることが判明し、頑健性がデータセット全体に均等に分布していないことを示している。
  • 著者らは、ℓ0およびℓ∞の高い頑健性を主張する防御が、MNISTの特異な特徴に過剰適合している可能性があり、意味的変化には一般化できないと観察している。
  • 現在の評価プロトコルではℓp-ボールが不十分である可能性が示唆されており、意味的に意味のあるがノルムの範囲内にある不変性に基づく脆弱性を検出できていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。