Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Adversarial Examples Is (Nearly) As Hard As Classifying Them

Florian Tramèr|arXiv (Cornell University)|Jul 24, 2021
Adversarial Robustness in Machine Learning被引用数 11
ひとこと要約

この論文は、敵対的例のロバスト検出とロバスト分類の間で形式的なハードネス還元を確立し、サイズ ϵ の摂動に対してロバストな検出器が、サイズ ϵ/2 の摂動に対して非効率的ではあるがロバストな分類器を構築するために使用できることを証明している。主な貢献は、敵対的例の検出が分類とほぼ同等に難しいことを示したことであり、これは、強力な検出主張が、しばしば現実的でないほど高いロバスト性を伴う分類性能を暗黙的に含意することを示唆しており、実験的検出防御に対する懸念を喚起する。

ABSTRACT

Making classifiers robust to adversarial examples is hard. Thus, many defenses tackle the seemingly easier task of detecting perturbed inputs. We show a barrier towards this goal. We prove a general hardness reduction between detection and classification of adversarial examples: given a robust detector for attacks at distance {\epsilon} (in some metric), we can build a similarly robust (but inefficient) classifier for attacks at distance {\epsilon}/2. Our reduction is computationally inefficient, and thus cannot be used to build practical classifiers. Instead, it is a useful sanity check to test whether empirical detection results imply something much stronger than the authors presumably anticipated. To illustrate, we revisit 13 detector defenses. For 11/13 cases, we show that the claimed detection results would imply an inefficient classifier with robustness far beyond the state-of-the-art.

研究の動機と目的

  • 敵対的例の検出と分類の難易度の間の形式的関係を確立すること。
  • 検出がロバスト分類よりも容易であるという仮定に疑問を呈すること。
  • 実験的検出防御の信憑性を評価するための理論的枠組みを提供すること。
  • 多くの検出ロバスト性に関する主張が、現在の最先端技術と矛盾する、画期的な分類ロバスト性の向上を暗黙的に含意していることを暴露すること。
  • 分類ロバスト性の隠れた含意により、検出主張が現実的にあり得ないほど強い場合に、今後の研究を導くこと。

提案手法

  • ロバスト検出からロバスト分類へのハードネス還元を提案し、距離 ϵ でロバストな検出器が、距離 ϵ/2 でロバストな分類器に変換可能であることを示している。
  • 最小距離デコード法を用いて、検出器から非効率的だが形式的に正しい分類器を構築している。
  • 14の実験的検出防御にこの還元を適用し、それらの主張するロバスト性が、現在の最先端技術よりもはるかに優れたロバスト性を持つ非効率な分類器を暗黙的に含意していることを示している。
  • リスク分解を用いて、敵対的攻撃下での検出器性能を分析し、偽陽性率と偽陰性率を分離している。
  • 認証済み防御と比較して還元のタイトネスを検証し、理論的境界とほぼ完全に一致することを示している。
  • 還元をサニティーチェックとして用いる:検出器が高ロバスト性を主張する場合、同程度の高ロバスト性を持つ分類器が暗黙的に存在することを示唆しており、これは現在の技術ではしばしば現実的でない。

実験結果

リサーチクエスチョン

  • RQ1ロバスト検出は根本的にロバスト分類よりも容易なのか、それとも計算的に同等なのか?
  • RQ2ϵ-摂動に対してロバストな検出器を用いて、ϵ/2-摂動に対してロバストな分類器を構築できるか?
  • RQ3実際の強い実験的検出主張は、同程度に強く、かつしばしば実現不可能な分類ロバスト性の向上を暗黙的に含意しているのか?
  • RQ4現在の検出器防御は、分類ロバスト性に対する認識されていない含意により、そのロバスト性を誇張している程度はどの程度か?
  • RQ5この還元は、より強力な攻撃によって破壊される前に、新しい検出防御の評価に一般的なサニティーチェックとして機能できるか?

主な発見

  • ℓp-摂動のサイズ ϵ に対してロバストな検出器は、サイズ ϵ/2 の摂動に対して非効率的だが形式的に正しい分類器を構築するために使用でき、検出が分類とほぼ同等に難しいことを証明している。
  • レビューした14の実験的検出防御のうち、12/14が、現在の最先端技術よりもはるかに優れたロバスト性を持つ非効率な分類器を暗黙的に含意するロバスト性レベルを主張しており、これは現実的でない主張を示唆している。
  • 例えば、MNIST で ℓ2 空間で ϵ = 8.9 において95%のロバスト検出精度を主張する検出器は、ϵ = 4.45 において56%のロバスト精度を持つ分類器を暗黙的に含意しており、これは現在の最高のロバスト分類器(ϵ = 2 で10%)を大きく上回る。
  • 認証済み防御のケースでは、還元の結果は実際の性能と非常に近い:Zhang et al. (2020a) は ϵ = 4/255 で39%の認証ロバスト精度を達成し、Sheikholeslami et al. (2021) は ϵ = 8/255 で37%のロバスト検出精度を達成しており、理論的境界から2%以内に収まっている。
  • 還元は、強い主張をする検出防御が、計算上の非効率性に暗黙的に依存しない限り、ロバスト性を誇張している可能性が高いことを明らかにしている。
  • 著者らは、検出防御が単に自らの主張に基づいて評価されるべきではなく、既知の最先端技術との比較によって、その暗黙的な分類ロバスト性が現実的かどうかを検証すべきだと主張している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。