Skip to main content
QUICK REVIEW

[論文レビュー] Is Robustness the Cost of Accuracy? -- A Comprehensive Study on the Robustness of 18 Deep Image Classification Models

Dong Su, Huan Zhang|arXiv (Cornell University)|Aug 5, 2018
Adversarial Robustness in Machine Learning参考文献 50被引用数 8
ひとこと要約

本稿では、18種類の最先端ImageNetモデルを用いて、複数の adversarial 攻撃手法と耐性指標を用いて、精度と耐性のトレードオフを調査している。本研究では、adversarial 変形と対数分類誤差の間には強い線形関係が存在することが判明し、モデルアーキテクチャがサイズよりも耐性に与える影響が大きいことが明らかになった。また、VGGモデルは複数のアーキテクチャ間で顕著に高い転送性を示し、モデル設計における新たな精度-耐性パレートフロンティアを提供している。

ABSTRACT

The prediction accuracy has been the long-lasting and sole standard for comparing the performance of different image classification models, including the ImageNet competition. However, recent studies have highlighted the lack of robustness in well-trained deep neural networks to adversarial examples. Visually imperceptible perturbations to natural images can easily be crafted and mislead the image classifiers towards misclassification. To demystify the trade-offs between robustness and accuracy, in this paper we thoroughly benchmark 18 ImageNet models using multiple robustness metrics, including the distortion, success rate and transferability of adversarial examples between 306 pairs of models. Our extensive experimental results reveal several new insights: (1) linear scaling law - the empirical $\ell_2$ and $\ell_\infty$ distortion metrics scale linearly with the logarithm of classification error; (2) model architecture is a more critical factor to robustness than model size, and the disclosed accuracy-robustness Pareto frontier can be used as an evaluation criterion for ImageNet model designers; (3) for a similar network architecture, increasing network depth slightly improves robustness in $\ell_\infty$ distortion; (4) there exist models (in VGG family) that exhibit high adversarial transferability, while most adversarial examples crafted from one model can only be transferred within the same family. Experiment code is publicly available at \url{https://github.com/huanzhang12/Adversarial_Survey}.

研究の動機と目的

  • 高精度なディープラーニングモデルが adversarial 攻撃に対して耐性を犠牲にしているかどうかを調査すること。
  • モデルサイズ、深さ、アーキテクチャといった要因が adversarial 耐性に与える影響を特定すること。
  • 精度-耐性パレートフロンティアを構築することで、耐性評価のベンチマークを確立すること。
  • さまざまなモデルファミリーおよびアーキテクチャ間での adversarial 例の転送性を分析すること。
  • 再現可能な ImageNet モデルの耐性評価のための公開コードベースを提供すること。

提案手法

  • AlexNet、VGG、ResNet、DenseNet、MobileNet、NASNet などを含む、複数のアーキテクチャにまたがる18体の事前学習済みImageNetモデルをベンチマーク化した。
  • 無差別および標的攻撃として、I-FGSM、C&W、EAD-L1 を用い、ℓ₂ および ℓ∞ 範囲での変形量(ε)を変化させた攻撃を実施した。
  • adversarial 変形(ℓ₂ および ℓ∞)、攻撃成功確率、およびモデル対間(合計306組)における転送性の3つの指標を用いて耐性を測定した。
  • 攻撃における最も可能性の低いラベルが意味的に関連しないことをWordNet階層を用いて検証し、ラベル感受性バイアスを最小限に抑えた。
  • Lipschitz定数解析や極値理論を含む攻撃に依存しない耐性推定技術を用い、研究結果の妥当性を検証した。
  • 実証結果に基づき、将来のモデル設計を支援する精度-耐性パレートフロンティアを構築した。

実験結果

リサーチクエスチョン

  • RQ1ImageNetモデルにおける高い分類精度は、adversarial 攻撃に対する耐性の低下と相関しているか?
  • RQ2モデルアーキテクチャ、サイズ、深さが、異なるモデル間で adversarial 耐性に与える影響は何か?
  • RQ3異なるアーキテクチャやファミリーのモデル間で、adversarial 例はどの程度転送されるか?
  • RQ4スケーラブルな指標を用いて、分類誤差からモデルの耐性を予測できるか?
  • RQ5adversarial 転送性を活用することで、ブラックボックスモデルのアーキテクチャを逆算的に特定できるか?

主な発見

  • 強い線形スケーリング法則が観察された:ℓ₂ および ℓ∞ の adversarial 変形指標は、分類誤差の対数に比例して線形に増加する。これは、高精度モデルが微小な摂動に対してより脆弱であることを示している。
  • モデルアーキテクチャはモデルサイズよりも耐性により重要な要因である。同じファミリー(例:VGG、ResNet)に属するモデルは、類似した耐性プロファイルを示す。
  • ResNet、Inception、DenseNetファミリーにおいて、深さの増加は ℓ∞ 耐性にわずかだが一貫した改善をもたらす。
  • VGGファミリーのモデルは、adversarial 例の転送性が顕著に高い。これらの例は他の17モデルすべてを効果的に欺くことができ、adversarial 行動におけるアーキテクチャの特徴が示唆される。
  • 非VGGモデルからの adversarial 例は、通常、自身のアーキテクチャファミリー内でのみ転送され、アーキテクチャの類似性が転送性を高めることを示している。
  • 本研究では、公開可能な精度-耐性パレートフロンティアを確立した。これは、将来のImageNetモデルの評価および設計を支援する新たなベンチマークとして利用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。