Skip to main content
QUICK REVIEW

[論文レビュー] Deep Neural Network Test Coverage: How Far Are We?

Junjie Chen, Ming Yan|arXiv (Cornell University)|Oct 10, 2020
Adversarial Robustness in Machine Learning参考文献 51被引用数 18
ひとこと要約

本研究は、テストセットサイズを制御した状態で、一般的に用いられる深層ニューラルネットワーク(DNN)のテストカバレッジメトリクスがテスト効果性と相関するかどうかを体系的に評価した。構造的カバレッジメトリクスは一般的に効果性を予測できないが、非構造的カバレッジは評価されたモデルの半数以上で有望な結果を示し、DNNテストにおけるテスト品質を測るには行動ベースのメトリクスがより信頼性が高いことを示唆している。

ABSTRACT

DNN testing is one of the most effective methods to guarantee the quality of DNN. In DNN testing, many test coverage metrics have been proposed to measure test effectiveness, including structural coverage and non-structural coverage (which are classified according to whether considering which structural elements are covered during testing). Those test coverage metrics are proposed based on the assumption: they are correlated with test effectiveness (i.e., the generation of adversarial test inputs or the error-revealing capability of test inputs in DNN testing studies). However, it is still unknown whether the assumption is tenable. In this work, we conducted the first extensive study to systematically validate the assumption by controlling for the size of test sets. In the study, we studied seven typical test coverage metrics based on 9 pairs of datasets and models with great diversity (including four pairs that have never been used to evaluate these test coverage metrics before). The results demonstrate that the assumption fails for structural coverage in general but holds for non-structural coverage on more than half of subjects, indicating that measuring the difference of DNN behaviors between test inputs and training data is more promising than measuring which structural elements are covered by test inputs for measuring test effectiveness. Even so, the current non-structural coverage metrics still can be improved from several aspects such as unfriendly parameters and unstable performance. That indicates that although a lot of test coverage metrics have been proposed before, there is still a lot of room for improvement of measuring test effectiveness in DNN testing, and our study has pointed out some promising directions.

研究の動機と目的

  • DNNテストにおけるテストカバレッジメトリクスがテスト効果性と相関するという広く共有された仮定を検証すること。
  • 構造的および非構造的カバレッジメトリクスが、敵対的入力を生成する能力やエラーを特定する能力を信頼性を持って予測できるかどうかを検討すること。
  • テストセットサイズがカバレッジ-効果性相関に与える影響を評価し、公平な評価を確保すること。
  • DNNテストにおけるカバレッジメトリクスを改善するための有望な方向性を同定すること。
  • 4つの以前にテストされていなかった組み合わせを含む、9つの多様なモデル-データセットペアにおいて7つのカバレッジメトリクスを評価すること。

提案手法

  • 本研究は、カバレッジがテスト効果性に与える影響を分離するために、固定されたテストセットサイズを用いた制御実験を実施した。
  • 4つの構造的および3つの非構造的基準に基づく、代表的な7つのテストカバレッジメトリクスを評価した。
  • 4つの以前にカバレッジメトリクスの評価に使われていなかった新しい組み合わせを含む、9つの多様なDNNモデルとデータセットを用いた。
  • テスト効果性は、テスト入力が敵対的例を生成する能力、またはモデル内のエラーを特定する能力によって測定された。
  • すべての被験対象において、カバレッジメトリクスとテスト効果性の相関を評価するために統計解析を実施した。
  • 構造的カバレッジ(例:ニューロン、レイヤー、活性化ベース)と非構造的カバレッジ(例:入力空間、行動ベース)を比較した。

実験結果

リサーチクエスチョン

  • RQ1テストセットサイズを制御した場合、DNNにおける構造的テストカバレッジはテスト効果性と相関するか?
  • RQ2同じ条件下で、DNNにおける非構造的テストカバレッジはテスト効果性と相関するか?
  • RQ3さまざまなDNNモデルとデータセットにおいて、異なるカバレッジメトリクスはどのように性能を発揮するか?
  • RQ4現在の非構造的カバレッジメトリクスに、信頼性を損なう特定の制限があるか?
  • RQ5DNNテストにおけるカバレッジメトリクスを改善するための最も有望な方向性は何か?

主な発見

  • 構造的カバレッジメトリクスは、評価されたモデル全体を通して一貫した相関を示さず、その使用に裏付けられる仮定は一般的に誤りであることが示された。
  • 非構造的カバレッジメトリクスは、評価対象の半数以上でテスト効果性と顕著な相関を示し、テスト品質を測る上でより有望であることが示唆された。
  • 本研究では、訓練データとテスト入力の間の行動的差異を測定する方が、どの構造的要素が活性化されたかを追跡するよりも効果的であることが判明した。
  • 現在の非構造的カバレッジメトリクスは依然として不安定なパフォーマンスとパラメータへの感受性を示しており、改善の余地があることが示された。
  • 結果から、今後の研究は構造的メトリクスよりも行動ベースのカバレッジメトリクスを優先すべきであると示唆された。
  • 以前にテストされていなかった4つのモデル-データセットペアの評価により、カバレッジ効果が多様なDNNアーキテクチャーやデータ分布によって顕著に異なることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。