Skip to main content
QUICK REVIEW

[論文レビュー] Active Learning Through a Covering Lens

Ofer Yehuda, Avihu Dekel|arXiv (Cornell University)|May 23, 2022
Machine Learning and Algorithms被引用数 12
ひとこと要約

本稿では、意味的埋め込み空間内の固定半径の球内での確率的カバレッジを最大化する枠組みとしてサブセット選択を定式化する、ProbCoverと呼ばれる新しいアクティブラーニング手法を提案する。自己教師あり表現と最大確率カバレッジの貪欲近似を活用することで、ラベル数が非常に少ない低予算設定において、先行手法を著しく上回り、CIFAR、ImageNet、および半教師ありベンチマークで最先端の性能を達成する。

ABSTRACT

Deep active learning aims to reduce the annotation cost for the training of deep models, which is notoriously data-hungry. Until recently, deep active learning methods were ineffectual in the low-budget regime, where only a small number of examples are annotated. The situation has been alleviated by recent advances in representation and self-supervised learning, which impart the geometry of the data representation with rich information about the points. Taking advantage of this progress, we study the problem of subset selection for annotation through a "covering" lens, proposing ProbCover - a new active learning algorithm for the low budget regime, which seeks to maximize Probability Coverage. We then describe a dual way to view the proposed formulation, from which one can derive strategies suitable for the high budget regime of active learning, related to existing methods like Coreset. We conclude with extensive experiments, evaluating ProbCover in the low-budget regime. We show that our principled active learning strategy improves the state-of-the-art in the low-budget regime in several image recognition benchmarks. This method is especially beneficial in the semi-supervised setting, allowing state-of-the-art semi-supervised methods to match the performance of fully supervised methods, while using much fewer labels nonetheless. Code is available at https://github.com/avihu111/TypiClust.

研究の動機と目的

  • 非常に少ないラベル例しか利用できない状況で標準的手法が失敗する深層アクティブラーニングにおける「コールドスタート」問題に対処すること。
  • わずか数個のサンプルしかラベル付けできない低予算環境で効果的な原理的根拠を持つアクティブラーニング戦略を開発すること。
  • 1-NN分類器の一般化誤差上界を最適化するために、サブセット選択を最大確率カバレッジとして定式化すること。
  • 意味的表現とカバレッジに基づく選択を活用することで、特に半教師あり学習において、既存手法を上回ることを示すこと。
  • 理論的カバレッジ原理と実用的アクティブラーニングのギャップを埋め、低予算において多様性と不確実性のみでは不十分であることを示すこと。

提案手法

  • アクティブラーニング問題を最大確率カバレッジとして定式化:半径δの球で囲まれたb個の例を選択し、それらがカバーする確率質量を最大化する。
  • 最適解の1−1/e近似保証を持つ貪欲アルゴリズムを用いて、近似的に最適なカバレッジを達成する。
  • 距離が意味的類似性と相関する自己教師あり埋め込み空間で動作させ、データ分布の意味的なカバレッジを可能にする。
  • 局所密度を評価し、代表的で高密度領域へ向かう選択を導くために、ガウスカーネル密度推定を用いてカバレッジを定義する。
  • 二重の設定に適応する:低予算用にProbCover(カバレッジ最大化)、高予算用にCoreset(サイズ最小化)と関連付ける。
  • SimCLRなどのモデルから得られる特徴量を用いて、教師ありおよび半教師あり設定に適用し、CIFAR-10、CIFAR-100、Tiny-ImageNet、ImageNetで評価する。

実験結果

リサーチクエスチョン

  • RQ1低予算アクティブラーニング設定において、カバレッジベースの定式化は不確実性および多様性抽出を上回ることができるか?
  • RQ2意味的埋め込み空間における確率的カバレッジの最大化は、1-NN分類器の一般化誤差上界を改善するか?
  • RQ3異なる予算設定において、ProbCoverはCoresetや他のアクティブラーニングベースラインと比較してどの程度の性能を示すか?
  • RQ4埋め込み空間の品質がProbCoverの性能にどの程度影響を与えるか?
  • RQ5ProbCoverは、大幅に少ないラベル数で半教師あり手法が完全教師あり性能に達するのを可能にするか?

主な発見

  • CIFAR-10、CIFAR-100、Tiny-ImageNet、ImageNetの全ベンチマークで、ProbCoverは低予算設定においてすべてのベースラインアクティブラーニング手法を著しく上回り、100個のラベル例でのランダム選択と比較して最大15%の精度向上を達成した。
  • 半教師あり設定では、ProbCoverにより最先端の半教師ありモデルが、完全教師ありモデルの性能を達成する一方で、ラベル数をたった10%にまで削減できた。
  • 初期プールがランダムであってもProbCoverの優位性が維持されることから、選択戦略自体の優位性が、初期選択バイアスに起因するものではないことが実証された。
  • 原始的なRGB空間にProbCoverを適用した場合、性能が著しく低下することが確認され、表現品質がカギを握っていることが裏付けられた。
  • δと予算サイズの相互作用から、予算が増加するにつれてより小さなδ値が最適であることが示され、適応的半径チューニングの有効性が示された。
  • 高予算設定ではCoresetがProbCoverを上回ることから、ProbCoverが低予算設定に特化しているという理論的かつ実験的主張が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。