Skip to main content
QUICK REVIEW

[論文レビュー] Online Active Model Selection for Pre-trained Classifiers

Mohammad Reza Karimi, Nezihe Merve Gürel|arXiv (Cornell University)|Oct 19, 2020
Machine Learning and Algorithms参考文献 33被引用数 6
ひとこと要約

本稿では、リアルタイムで情報量の多い未ラベル付き例を問い合わせることで、最小限のラベル付けで高信頼性で最良の事前学習済み分類器を特定できるオンラインアクティブモデル選択アルゴリズム「Model Picker」を提案する。最先端の性能を達成し、ImageNetのラベルのわずか13%で102個のモデルの中から90%の信頼度で最良のモデルを選べる。ベースラインより最大2.5倍のラベル効率向上と1.3倍のレグレット低減を達成した。

ABSTRACT

Given $k$ pre-trained classifiers and a stream of unlabeled data examples, how can we actively decide when to query a label so that we can distinguish the best model from the rest while making a small number of queries? Answering this question has a profound impact on a range of practical scenarios. In this work, we design an online selective sampling approach that actively selects informative examples to label and outputs the best model with high probability at any round. Our algorithm can be used for online prediction tasks for both adversarial and stochastic streams. We establish several theoretical guarantees for our algorithm and extensively demonstrate its effectiveness in our experimental studies.

研究の動機と目的

  • 限られたラベル付け予算のもとで、k個のモデルの中から最良の事前学習済み分類器を選択するという課題に対処すること。
  • 大規模なデータプールを保存せずに、リアルタイムで情報量の多い例をラベル付け対象として選択するオンラインアクティブラーニングフレームワークを設計すること。
  • i.i.d.仮定に依存せずに、確率的および悪意のあるデータストリームの両方においても頑健な性能を発揮すること。
  • 順次ラベル予測におけるレグレットを最小限に抑えつつ、真の最良モデルを特定する確率を最大化すること。
  • 従来手法よりも顕著に少ないクエリで正確なモデル選択を実現する、高いラベル効率を達成すること。

提案手法

  • Model Pickerは、仮想のラベル反応を活用して、各到着した例が最良のモデルを区別する上でどれほど情報量があるかを推定する確率的クエリ戦略を用いる。
  • モデル性能に関する信頼区間を維持し、モデルランクの不確実性を最も効果的に低減できる例を動的に選択する。
  • バンドイット風のフィードバックメカニズムを採用し、オンラインかつ逐次的にモデルの信頼度を更新し、将来のクエリ意思決定を導く。
  • 悪意のあるストリームに対しても理論的保証を備え、完全ラベルアクセスアルゴリズムの最良知見に一致するノーレグレット性能を証明する。
  • スケーラビリティを考慮し、ストリーミングおよび非ステーションリティックなデータ分布(例:コンセプトドリフトを含む)にも適用可能である。
  • 統計的一致性とモデル同定の頑健性を確保するため、インポートランスウェイティングと信頼度キャリブレーションを統合する。

実験結果

リサーチクエスチョン

  • RQ1完全ラベルにアクセスできない状況下でも、順次ラベル予測において低レグレットを達成できるオンラインアクティブモデル選択アルゴリズムは可能か?
  • RQ2ストリーム形式のオンライン環境において、最小限のラベルクエリでk個のモデルの中から最良の事前学習モデルを効率的に特定する方法は何か?
  • RQ3悪意のあるデータストリーム下でも、モデル選択の高信頼性をどの程度維持できるか?
  • RQ4Model Pickerのラベル効率は、さまざまなデータセットにおいて、既存のアクティブラーニングおよびモデル選択ベースラインと比較してどの程度優れているか?
  • RQ5Model Pickerが真の最良モデルを高い確率で特定するための最小ラベル付け予算はどの程度か?

主な発見

  • ImageNetデータセットにおいて、Model Pickerは102個の事前学習済みモデルの中から90%の信頼度で最良のモデルを特定するのに、ラベルのわずか13%で達成した。
  • 同じ精度の目標を達成するため、Model Pickerは、エントロピー法や効率的(Label-Efficient Prediction)の手法を含む競合手法と比較して最大2.5倍少ないラベルを必要とした。
  • Driftデータセットでは、ストリームの11%をラベル付けした後、Model Pickerは最良モデルの精度から0.1%以内の性能を達成したのに対し、最良のベースラインは24%を必要とした。
  • EmoContextデータセットでは、Model Pickerは最良のベースライン比2.6倍のラベルコスト削減を達成し、真の最良モデルを97%の信頼度で特定するにあたり、1.7倍少ないクエリで実現した。
  • 実現の90パーセンタイルにおいて、Model PickerはDriftデータセットストリームの8%をラベル付けした後、最良モデルの精度から0.1%以内のモデルを返した。
  • すべてのデータセットにおいて、Model Pickerはベースラインより最大1.3倍の低いレグレットを達成し、順次予測タスクにおける優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。