Skip to main content
QUICK REVIEW

[論文レビュー] DeepGD: A Multi-Objective Black-Box Test Selection Approach for Deep Neural Networks

Zohreh Aghababaeyan, Manel Abdellatif|arXiv (Cornell University)|Mar 8, 2023
Adversarial Robustness in Machine Learning参考文献 70被引用数 4
ひとこと要約

DeepGD は、故障検出を最大化し、ラベル付けコストを最小化するために、高い不確実性と多様性を持つラベルなし入力を優先するブラックボックス型、マルチオブジェクティブなテスト選択手法である。深層ニューラルネットワークのテストに特化しており、既存のホワイトボックスおよびブラックボックス手法を上回る故障発見性能を発揮するとともに、情報性の高いテスト入力を選択することでモデル再訓練の精度を向上させる。

ABSTRACT

Deep neural networks (DNNs) are widely used in various application domains such as image processing, speech recognition, and natural language processing. However, testing DNN models may be challenging due to the complexity and size of their input domain. Particularly, testing DNN models often requires generating or exploring large unlabeled datasets. In practice, DNN test oracles, which identify the correct outputs for inputs, often require expensive manual effort to label test data, possibly involving multiple experts to ensure labeling correctness. In this paper, we propose DeepGD, a black-box multi-objective test selection approach for DNN models. It reduces the cost of labeling by prioritizing the selection of test inputs with high fault revealing power from large unlabeled datasets. DeepGD not only selects test inputs with high uncertainty scores to trigger as many mispredicted inputs as possible but also maximizes the probability of revealing distinct faults in the DNN model by selecting diverse mispredicted inputs. The experimental results conducted on four widely used datasets and five DNN models show that in terms of fault-revealing ability: (1) White-box, coverage-based approaches fare poorly, (2) DeepGD outperforms existing black-box test selection approaches in terms of fault detection, and (3) DeepGD also leads to better guidance for DNN model retraining when using selected inputs to augment the training set.

研究の動機と目的

  • DNN テストにおける大規模なラベルなしデータセットのラベル付けコストの高さに取り組むこと、特にモデルの内部構造が入手できない状況を想定する。
  • 内部メトリクスに依存するホワイトボックスのカバレッジベースのテスト選択に依存を減らすこと、これはしばしば実際の誤予測と相関しないことがある。
  • 不確実性と多様性を活用して故障発見能力を最大化するブラックボックス型テスト選択手法を開発すること。
  • 情報性の高いテスト入力の選択により、モデル再訓練の品質を向上させること。
  • 反復的な人間によるラベル付けを必要とするアクティブラーニングとは異なり、一回のラベル付けで済ませるコスト効率の高いソリューションを提供すること。

提案手法

  • DeepGD は、予測の信頼性が低いか、エントロピーが高いことで、誤予測の可能性が高くなるとされる入力を、モデル出力の不確実性スコアに基づいて特定する。
  • 入力の多様性は、最後の隠れ層における入力埋め込み同士の距離を測定することで算出され、選択された入力が入力空間の異なる領域をカバーするように保証される。
  • 高不確実性と高多様性をバランスさせるマルチオブジェクティブ最適化フレームワークを用いて、故障検出能力を最大化するテスト入力を選択する。
  • モデルの内部構造や学習データへのアクセスが不要であるため、第三者や特許を取得した DNN に対しても適用可能である。
  • 固定された予算内で、ラベルなしデータセットを探索し、コン pact かつ高い影響を持つテストセットを探索・選択するための探索ベースのアプローチを採用する。
  • 選択された入力は、テストと再訓練の両方で使用され、最小限のラベル付け作業でモデルの頑健性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1不確実性と多様性を組み合わせたブラックボックス型テスト選択手法が、DNN の故障検出においてホワイトボックスのカバレッジベース手法を上回ることができるか?
  • RQ2同じラベル付け予算のもとで、DeepGD の故障発見能力は、既存のブラックボックス型テスト選択手法と比較してどの程度優れているか?
  • RQ3DeepGD が選択した入力を用いて再訓練を行うことで、DNN モデルの精度と故障耐性はどの程度向上するか?
  • RQ4不確実性と多様性の組み合わせが、単独で用いる場合よりも優れた故障検出能力を発揮するか?
  • RQ5DeepGD は、複雑な入力分布を示す多様な DNN アーキテクチャとデータセットに対しても有効であるか?

主な発見

  • DeepGD は、内部モデルメトリクスに依存するホワイトボックス型カバレッジベース手法と比較して、故障検出性能において顕著に優れている。
  • DeepGD は、テスト入力選択において不確実性と多様性を効果的にバランスさせることで、既存のブラックボックス手法を上回る高い故障発見能力を達成している。
  • 本手法は、選択されたテスト入力を訓練データに追加することで、再訓練の結果を改善し、精度向上を実現している。
  • 2番目に優れたテスト選択手法は、モデルやデータセットによって変動するため、いかなるアプローチも普遍的に優位に立つわけではないことが示され、DeepGD のマルチオブジェクティブ戦略の堅牢性が裏付けられている。
  • DeepGD は、4つの広く使われているデータセットと5つの DNN モデルで一貫した性能を示しており、一般化能力が確認されている。
  • DeepGD は、ラベル付けコストを削減するため、ラベルなしデータの小さな高インパクトなサブセットに焦点を当てており、予算が限られた実世界のテストにおいて実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。