Skip to main content
QUICK REVIEW

[論文レビュー] Active Testing: Sample-Efficient Model Evaluation

Jannik Kossen, Sebastian Farquhar|arXiv (Cornell University)|Mar 9, 2021
Machine Learning and Algorithms参考文献 53被引用数 14
ひとこと要約

本稿では、モデル評価のためのサンプル効率性に優れたフレームワーク「アクティブテスト」を提案する。このフレームワークは、正確な性能推定に必要なラベル数を削減するため、最も情報量の多いテストポイントを能動的に選択する。タスク固有の獲得関数を導出し、LURE推定法を用いて選択バイアスを補正することで、小規模なラベル予算でもランダムサンプリングに比べてはるかに正確なテスト損失および正答率の推定が可能になる。

ABSTRACT

We introduce a new framework for sample-efficient model evaluation that we call active testing. While approaches like active learning reduce the number of labels needed for model training, existing literature largely ignores the cost of labeling test data, typically unrealistically assuming large test sets for model evaluation. This creates a disconnect to real applications, where test labels are important and just as expensive, e.g. for optimizing hyperparameters. Active testing addresses this by carefully selecting the test points to label, ensuring model evaluation is sample-efficient. To this end, we derive theoretically-grounded and intuitive acquisition strategies that are specifically tailored to the goals of active testing, noting these are distinct to those of active learning. As actively selecting labels introduces a bias; we further show how to remove this bias while reducing the variance of the estimator at the same time. Active testing is easy to implement and can be applied to any supervised machine learning method. We demonstrate its effectiveness on models including WideResNets and Gaussian processes on datasets including Fashion-MNIST and CIFAR-100.

研究の動機と目的

  • 実世界の機械学習応用において、テストラベルがトレーニングラベルと同等に高コストである場合に、テストデータのラベリングコストを低減すること。
  • トレーニングデータのためのアクティブラーニングと、テストデータのためのモデル評価の間のサンプル効率性の格差を是正すること。この格差は、これまでほとんど無視されてきた。
  • 深層ニューラルネットワークやベイジアンモデルを含む、任意の教師あり学習モデルに適用可能な一般化された、体系的なフレームワークを構築すること。
  • 能動的なテストポイント選択によって生じるバイアスを是正すること。このバイアスは、特に過信度の高いモデルでは、モデル誤差を過大評価する。
  • アクティブテストが、はるかに大きなテストセットを用いたランダムサンプリングに匹敵またはそれを上回る精度で、正確な性能推定に必要なテストラベル数を著しく削減できることを実証すること。

提案手法

  • モデル性能推定に必要なラベル数を最小限に抑えるために、最も情報量の多いテストポイントを選択するフレームワークとしてアクティブテストを提案する。
  • 分類と回帰のタスク固有の獲得関数を、予測エントロピーと期待損失に基づいて導出し、学習とは異なり評価を目的としたものに特化させる。
  • 元のモデルの不確実性と誤差を捉えるために、アンサンブルによる多様性と忠実度を高めるサロゲートモデルを導入する。
  • 選択バイアスを補正するため、LURE(損失不偏リスク推定法)の重み付け方式を適用し、不偏かつ分散が小さい性能推定を実現する。
  • モンテカルロサンプリングを用いてテスト損失およびその他の評価指標を推定し、推定器の分散を低減するのに最も寄与するポイントを優先する獲得戦略を採用する。
  • 二段階のアプローチを採用する:第一段階では、元のモデルまたはサロゲートモデルを用いて候補となるテストポイントをスコア化する。第二段階では、ラベルを取得し、繰り返しサロゲートモデルを更新することで、将来の選択を改善する。

実験結果

リサーチクエスチョン

  • RQ1能動的なテストデータ選択は、バイアスを導入することなく、正確なモデル評価に必要なラベル数を削減できるか?
  • RQ2評価の目的と学習の目的が異なることを考慮すると、アクティブテスト用の獲得関数はアクティブラーニングで用いられるものとどのように異なるか?
  • RQ3サロゲートモデルを用いることで、元のモデルに依存するのみの状況と比較して、アクティブテストの精度と効率はどの程度向上するか?
  • RQ4アクティブテストにおけるバイアスは効果的に是正可能か?また、その是正はより信頼性の高い性能推定をもたらすか?
  • RQ5実際の応用において、サロゲートモデルの忠実度と多様性は、アクティブテストの性能にどのように影響を与えるか?

主な発見

  • アクティブテストは、Fashion-MNISTおよびCIFAR-100において、ランダムサンプリングと同等の推定精度を達成しながら、必要なテストラベル数を最大50%まで削減できる。
  • 予測エントロピーに基づく獲得関数が、相互情報量を上回る性能を示す。これは、相互情報量がアクティブラーニングに適しており、期待損失を直接的にターゲットとしないからである。
  • LURE推定法は、選択バイアスを効果的に除去し、特に過信度の高いモデルではテスト損失の過大評価を防ぎ、推定器の分散を低減する。
  • 特にディープアンサンブルサロゲートを用いることで、サロゲートモデルはアクティブテストの性能を著しく向上させる。忠実度と多様性の両方が、より高いサンプル効率に寄与する。
  • 新しいラベルが得られるたびにサロゲートモデルを再訓練することで性能が向上するが、再訓練を行わないサロゲートモデルですら、単に元のモデルの不確実性に依存するナーブな戦略を上回る。
  • 本フレームワークは、広範なモデルに一般化可能で、WideResNets、ベイジアンニューラルネットワーク、ガウス過程、ランダムフォレストを含む多様なモデルにおいて、回帰および分類の両タスクで有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。