Skip to main content
QUICK REVIEW

[論文レビュー] Test Selection for Deep Learning Systems

W. F. Mader, Mike Papadakis|arXiv (Cornell University)|Apr 30, 2019
Adversarial Robustness in Machine Learning参考文献 25被引用数 8
ひとこと要約

本稿では、モデルの信頼度とドロップアウト分散を活用して、モデルを挑戦させるデータを特定し、精度を向上させる、不確実性に基づくテスト選択メトリクスを提案する。このアプローチは、ランダム選択や最先端のメトリクスと比較して、再訓練における精度向上を最大80%向上させる。

ABSTRACT

Testing of deep learning models is challenging due to the excessive number and complexity of computations involved. As a result, test data selection is performed manually and in an ad hoc way. This raises the question of how we can automatically select candidate test data to test deep learning models. Recent research has focused on adapting test selection metrics from code-based software testing (such as coverage) to deep learning. However, deep learning models have different attributes from code such as spread of computations across the entire network reflecting training data properties, balance of neuron weights and redundancy (use of many more neurons than needed). Such differences make code-based metrics inappropriate to select data that can challenge the models (can trigger misclassification). We thus propose a set of test selection metrics based on the notion of model uncertainty (model confidence on specific inputs). Intuitively, the more uncertain we are about a candidate sample, the more likely it is that this sample triggers a misclassification. Similarly, the samples for which we are the most uncertain, are the most informative and should be used to improve the model by retraining. We evaluate these metrics on two widely-used image classification problems involving real and artificial (adversarial) data. We show that uncertainty-based metrics have a strong ability to select data that are misclassified and lead to major improvement in classification accuracy during retraining: up to 80% more gain than random selection and other state-of-the-art metrics on one dataset and up to 29% on the other.

研究の動機と目的

  • 深層学習システムにおける体系的で自動化されたテストデータ選択の欠如に対処すること。
  • 深層ニューラルネットワークにおけるモデル動作を捉えきれない、コードベースのテストメトリクス(例:カバレッジ)の限界を克服すること。
  • 意思決定境界付近でのモデルの不確実性に注目し、誤分類を引き起こす可能性の高いテスト入力を特定すること。
  • 不確実性に基づくメトリクスが、再訓練による精度向上においてランダム選択や既存の最先端メトリクスを上回るかどうかを評価すること。
  • 自己学習型深層学習システムにおけるテスト効果の評価に実用的で客観的なフレームワークを提供すること。

提案手法

  • モンテカルロドロップアウトを用いて、繰り返しニューロンをドロップさせ、予測分散を測定することで、モデルの不確実性を推定するテスト選択メトリクスを提案する。
  • モデルの出力確率(信頼度)を別個の確実性指標として用い、ドロップアウト分散と組み合わせることで感度を向上させる。
  • 複数の適切性メトリクスを定義する:分散(Var)、カルバック・ライブラー発散(KL)、ラベル固有活性化(LSA)、最小活性化までの距離(DSA)、重み付き分散(Var_w)および確率ベースのタイブレーキング。
  • CIFAR-10 および MNIST の2つの画像分類ベンチマークでメトリクスを評価し、実際の入力および悪意のある入力を用いる。
  • メトリクスと誤分類の相関関係を評価し、選択されたデータを用いてモデルを再訓練した際の精度向上を測定する。
  • 1イテレーションあたり5,000件の上位スコアデータを訓練セットに追加する反復的再訓練を実施し、エポックごとのバリデーション精度を追跡する。

実験結果

リサーチクエスチョン

  • RQ1不確実性に基づくメトリクスは、深層学習モデルが誤分類する入力を効果的に特定できるか?
  • RQ2ランダム選択や最先端メトリクス(例:サプライズ適切性)と比較して、不確実性に基づくメトリクスは誤分類を引き起こす可能性にどの程度優れているか?
  • RQ3不確実性に基づくメトリクスを用いてデータ再訓練を誘導することで、モデル精度はどの程度向上するか?
  • RQ4悪意のある入力と実際の正しく分類された入力とで、メトリクスの性能はどのように異なるか?
  • RQ5不確実性メトリクスは再訓練中のモデル収束を早めるか?

主な発見

  • 不確実性に基づくメトリクス、特に Var と KL は、悪意のある CIFAR-10 データにおいて誤分類と強い相関( Kendall’s tau = 0.8099 )を示した。
  • MNIST では、確率ベースのタイブレーキングを組み合わせたメトリクスが、3回の再訓練イテレーション後にバリデーション精度を2.7%向上させ、ランダム選択や LSA/DSA を上回った。
  • 提案されたメトリクスは、MNIST データセットにおいて、3回のイテレーション後にランダム選択や最先端メトリクスと比較して、最大80%の精度向上を達成した。
  • CIFAR-10 では、ベースライン手法と比較して29%の精度向上を達成し、Var と P が最も優れた結果を出した。
  • 不確実性で選択されたデータを用いて訓練したモデルは、特に中間の訓練イテレーションにおいて、収束が速くなったことがバリデーション精度曲線から明らかになった。
  • 悪意のあるデータでは、悪意のある摂動によって不確実性が高くなり、メトリクスの識別力が低下したため、効果が薄れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。