Skip to main content
QUICK REVIEW

[論文レビュー] There is Limited Correlation between Coverage and Robustness for Deep Neural Networks

Yizhen Dong, Peixin Zhang|arXiv (Cornell University)|Nov 14, 2019
Adversarial Robustness in Machine Learning参考文献 41被引用数 20
ひとこと要約

本研究では、25のメトリクスを用いて100のモデルを対象に、深層ニューラルネットワーク(DNN)のテストカバレッジと耐性の関係を実証的に評価した。カバレッジ基準と耐性の間に限定的な相関関係が見られ、高いカバレッジがより耐性のあるモデルをもたらすという仮定に疑問を呈し、今後のDNNテスト研究のための公開ベンチマークを提供した。

ABSTRACT

Deep neural networks (DNN) are increasingly applied in safety-critical systems, e.g., for face recognition, autonomous car control and malware detection. It is also shown that DNNs are subject to attacks such as adversarial perturbation and thus must be properly tested. Many coverage criteria for DNN since have been proposed, inspired by the success of code coverage criteria for software programs. The expectation is that if a DNN is a well tested (and retrained) according to such coverage criteria, it is more likely to be robust. In this work, we conduct an empirical study to evaluate the relationship between coverage, robustness and attack/defense metrics for DNN. Our study is the largest to date and systematically done based on 100 DNN models and 25 metrics. One of our findings is that there is limited correlation between coverage and robustness, i.e., improving coverage does not help improve the robustness. Our dataset and implementation have been made available to serve as a benchmark for future studies on testing DNN.

研究の動機と目的

  • 安全性が求められる応用分野における、既存のDNNテストカバレッジ基準とモデルの耐性の相関関係を調査すること。
  • テストデータを用いた微調整後のカバレッジ向上と耐性向上の関係を評価すること。
  • より良いテストの指針を得るために、耐性または耐性向上と強く相関するメトリクスを同定すること。
  • 実世界のモデルと敵対的サンプルを用いて、包括的かつ再現可能なDNNテスト研究のためのベンチマークを確立すること。

提案手法

  • MNISTおよびCIFAR-10データセットを用いて、多様なアーキテクチャを用いて100の最先端DNNモデルを訓練した。
  • FGSM、JSMA、C&Wの3つの最先端の攻撃を用いて敵対的サンプルを生成し、多様な訓練セットを作成した。
  • ニューロンカバレッジ、DeepGauge、MC/DC、サプライズ適正性を含む10以上のカバレッジ基準を実装および評価した。
  • CLEVERスコアと複数の攻撃における敵対的攻撃成功確率の2つのメトリクスを用いて耐性を測定した。
  • 25のメトリクスを用いた相関分析(ピアソンおよびスピアマン)により、カバレッジ、耐性、および改善度の間の関係を評価した。
  • すべてのモデル、敵対的サンプル、およびコードを公開し、今後のDNNテスト研究のためのベンチマークを提供した。

実験結果

リサーチクエスチョン

  • RQ1DNNのテストカバレッジ基準と耐性の間に相関関係は存在するか?
  • RQ2異なるカバレッジ基準同士の間に相関関係は存在するか?
  • RQ3微調整後のカバレッジ基準の向上と耐性の向上の間に相関関係は存在するか?
  • RQ4DNNの耐性または微調整後の耐性向上と強く相関するメトリクスは存在するか?

主な発見

  • ニューロンカバレッジやDeepGaugeなどのカバレッジ基準とDNNの耐性の間に、限定的ないし顕著な相関関係は見られず、カバレッジ駆動テストの基礎的仮定に疑問を呈する。
  • 敵対的サンプルを用いた微調整によるカバレッジ向上は、CLEVERスコアや敵対的攻撃成功確率で測定した耐性向上に一貫してつながるわけではない。
  • MC/DC やサプライズ適正性といった高度な基準を用いても、カバレッジと耐性の間の相関関係は依然として弱いままである。
  • CLEVERスコアなどの耐性メトリクスは、カバレッジメトリクスよりも敵対的攻撃成功確率とより強い相関関係を示す。
  • 敵対的サンプルを用いた微調整後の耐性向上を、カバレッジ基準が信頼性を持って予測できない。
  • 本研究では、100のDNNモデル、敵対的サンプル、およびメトリクス実装を含む、公開可能なベンチマークを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。