Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Robustness Assessment: Why both $L_0$ and $L_\infty$ Attacks Are Necessary

Shashank Kotyan, Danilo Vargas|arXiv (Cornell University)|Jun 14, 2019
Adversarial Robustness in Machine Learning参考文献 40被引用数 9
ひとこと要約

本稿では、$L_0$ および $L_\infty$ の敵対的攻撃を用いて、モデルに依存しない二重の品質評価フレームワークを提案し、既存の評価手法におけるバイアスを是正する。本稿は、これらのノルム間で堅牢性が顕著に異なることを示し、ワンピクセル攻撃の12%の摂動で同等の成功を達成するが、摂動量を著しく低減した新しい $L_\infty$ ブラックボックス攻撃を導入する。

ABSTRACT

There exists a vast number of adversarial attacks and defences for machine learning algorithms of various types which makes assessing the robustness of algorithms a daunting task. To make matters worse, there is an intrinsic bias in these adversarial algorithms. Here, we organise the problems faced: a) Model Dependence, b) Insufficient Evaluation, c) False Adversarial Samples, and d) Perturbation Dependent Results). Based on this, we propose a model agnostic dual quality assessment method, together with the concept of robustness levels to tackle them. We validate the dual quality assessment on state-of-the-art neural networks (WideResNet, ResNet, AllConv, DenseNet, NIN, LeNet and CapsNet) as well as adversarial defences for image classification problem. We further show that current networks and defences are vulnerable at all levels of robustness. The proposed robustness assessment reveals that depending on the metric used (i.e., $L_0$ or $L_\infty$), the robustness may vary significantly. Hence, the duality should be taken into account for a correct evaluation. Moreover, a mathematical derivation, as well as a counter-example, suggest that $L_1$ and $L_2$ metrics alone are not sufficient to avoid spurious adversarial samples. Interestingly, the threshold attack of the proposed assessment is a novel $L_\infty$ black-box adversarial method which requires even less perturbation than the One-Pixel Attack (only $12\%$ of One-Pixel Attack's amount of perturbation) to achieve similar results. Code is available at http://bit.ly/DualQualityAssessment.

研究の動機と目的

  • 既存の攻撃および評価指標に起因するバイアスのため、敵対的機械学習におけるモデルに依存しない包括的な堅牢性評価の欠如を是正する。
  • モデル依存性、評価の不十分さ、偽の敵対的サンプル、摂動依存の結果といった堅牢性評価における問題を克服する。
  • $L_0$(少数ピクセル)および $L_\infty$(しきい値)ノルムを用いた二重評価フレームワークを構築し、高品質で人間が検出可能な敵対的サンプルを保証し、誤った評価を回避する。
  • しきい値 $th$ を用いた堅牢性レベルを定義し、摂動の大きさに応じたさまざまなスケールで神経ネットワークおよび防御機構の効率的かつスケーラブルな評価を可能にする。
  • 最先端のネットワークおよび防御機構に対してフレームワークを検証し、いかなるモデルも $L_0$ および $L_\infty$ 攻撃の両方に同時に堅牢ではないことを示す。

提案手法

  • モデル依存性を排除し、多様なアーキテクチャの評価を可能にする、モデルに依存しない勾配非依存のブラックボックス攻撃フレームワークを提案する。
  • モデルの勾配やターゲットシステムに関する仮定に依存しない、CMA-ES最適化を用いた新しい $L_\infty$ ブラックボックス敵対的攻撃を導入する。
  • 最大許容摂動量を制御するしきい値 $th$ を用いて堅牢性レベルを定義し、さまざまな堅牢性スケールにわたる体系的な評価を可能にする。
  • $L_0$(少数ピクセル)および $L_\infty$(しきい値)攻撃を用いた二重評価を実施し、一貫性のないまたは人間が検出できない敵対的サンプルを防ぐために空間的分布制約を確保する。
  • 敵対的正答率としきい値 $th$ のAUC(曲線下積分)を台形則を用いて計算し、モデル間での定量的比較を可能にする。
  • 反例および数学的解析を活用し、$L_1$ および $L_2$ 指標のみでは偽の敵対的サンプルを回避できないことを示す。

実験結果

リサーチクエスチョン

  • RQ1なぜ、単一のノルムに依存するのではなく、$L_0$ および $L_\infty$ の両方の敵対的攻撃を用いて堅牢性を評価する必要があるのか?
  • RQ2現在の最先端の神経ネットワークおよび敵対的防御機構は、さまざまな堅牢性レベルにおいて、二重の $L_0$ および $L_\infty$ ブラックボックス攻撃に対してどのように評価されるか?
  • RQ3既存の手法よりも著しく少ない摂動量で高い成功率を達成できる、新しい $L_\infty$ ブラックボックス攻撃を設計できるか?
  • RQ4$L_0$ および $L_\infty$ 攻撃が、敵対的正答率が類似している場合でも、同じモデルにおいて異なる脆弱性を露呈する程度はどの程度か?
  • RQ5CapsNet、ResNet、LeNet などの異なるアーキテクチャの堅牢性行動は、$L_0$ および $L_\infty$ 攻撃において、堅牢性レベルを用いてどのように異なるか?

主な発見

  • 評価されたいかなる神経ネットワークや防御機構に対しても、低しきい値であっても $L_0$ および $L_\infty$ 攻撃の両方に堅牢ではないことが判明し、広範な脆弱性を示している。
  • 提案された $L_\infty$ ブラックボックス攻撃は、ワンピクセル攻撃に比べて摂動量を12%にまで低減しながら、同等の敵対的成功確率を達成している。
  • ResNet($th=10$)では、$L_0$ 攻撃と $L_\infty$ 攻撃の敵対的正答率の差はわずか2%にとどまるが、17%のテストサンプルは片方のノルムのみで攻撃可能である。
  • CapsNetは $L_0$ 攻撃に対して最も高い堅牢性を示し(表Vの最高AUC)、AllConvは $L_\infty$ 攻撃に対して最良の性能を示している。
  • $L_0$ および $L_\infty$ 攻撃のAUC曲線は、モデルごとに異なるスケーリングを示しており、CapsNetは他のモデルと明確に異なる堅牢性プロファイルを示している。
  • 二重評価フレームワークにより、数学的導出および反例によって、$L_1$ および $L_2$ 指標のみでは偽の敵対的サンプルを回避できないことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。