Skip to main content
QUICK REVIEW

[論文レビュー] SIMILAR: Submodular Information Measures Based Active Learning In Realistic Scenarios

Suraj Kothawade, Nathan Beck|arXiv (Cornell University)|Jul 1, 2021
Machine Learning and Algorithms参考文献 45被引用数 22
ひとこと要約

本稿では、クラス不均衡、重複、分布外(OOD)データといった現実的課題に対応するため、部分集合的情報測度(SIM)を獲得関数として用いる統合的アクティブラーニングフレームワーク、SIMILARを提案する。分布内(ID)およびOODセットへの条件付き処理を組み込むことで、CIFAR-10、MNIST、ImageNetの各データセットにおいて、最先端のベースラインと比較してレアクラスの精度が最大18%向上し、OODシナリオで10%の向上を達成した。

ABSTRACT

Active learning has proven to be useful for minimizing labeling costs by selecting the most informative samples. However, existing active learning methods do not work well in realistic scenarios such as imbalance or rare classes, out-of-distribution data in the unlabeled set, and redundancy. In this work, we propose SIMILAR (Submodular Information Measures based actIve LeARning), a unified active learning framework using recently proposed submodular information measures (SIM) as acquisition functions. We argue that SIMILAR not only works in standard active learning, but also easily extends to the realistic settings considered above and acts as a one-stop solution for active learning that is scalable to large real-world datasets. Empirically, we show that SIMILAR significantly outperforms existing active learning algorithms by as much as ~5% - 18% in the case of rare classes and ~5% - 10% in the case of out-of-distribution data on several image classification tasks like CIFAR-10, MNIST, and ImageNet. SIMILAR is available as a part of the DISTIL toolkit: "https://github.com/decile-team/distil".

研究の動機と目的

  • クラス不均衡、重複、分布外(OOD)データといった非理想な現実的データシナリオにおける、既存のアクティブラーニング手法の限界を解決すること。
  • 多様な実世界のアクティブラーニング設定において、大規模な再設定を必要とせずに高いパフォーマンスを維持できる、単一でスケーラブルなフレームワークの開発。
  • 現在の手法が一般化に失敗する、まれなサンプルやOODサンプルを含むシナリオにおける、不確実性ベースおよび多様性ベースの獲得関数の欠陥を克服すること。
  • 部分集合的情報測度(SIM)を用いて、分布内およびOODセットへの条件付き処理を実施することで、ロバストで安定したアクティブラーニング性能を実現すること。

提案手法

  • 情報量と多様性の両方をバランスさせるために、部分集合的情報測度(SIM)を獲得関数として用いる統合的アクティブラーニングフレームワーク、SIMILARを提案する。
  • 2つの主要なバリエーションを導入:SMI(部分集合的相互情報量)とSCMI(部分集合的条件付き相互情報量)、ここでSCMIは分布内(ID)およびOODセットへの明示的な条件付けを実施し、選択精度を向上させる。
  • LogdetcmiおよびFlcmiといったSCMI関数を用い、事前に選択されたIDおよびOODポイントを条件として組み込むことで、不確実性と多様性を両立させる。
  • 時間経過に伴い、常に更新を行う2つのセット(分布内(ID)セットおよび分布外(OOD)セット)を維持する。
  • 深層ニューラルネットワークの特徴表現を活用し、類似度計算を可能とすることで、スケーラブルな情報量と多様性の高いサンプル選択を実現する。
  • オープンソースでの利用および実世界への展開を目的として、DISTILツールキットにフレームワークを統合する。

実験結果

リサーチクエスチョン

  • RQ1単一のアクティブラーニングフレームワークが、同時に稀なクラス、重複、OODデータといった複数の現実的課題を効果的に処理できるか?
  • RQ2分布内および分布外セットへの条件付けを施すことで、標準的な獲得関数と比較して、アクティブラーニングのパフォーマンスがどの程度向上するか?
  • RQ3部分集合的情報測度(SMIおよびSCMI)が、不確実性ベースおよび多様性ベースのベースラインと比較して、異なるデータセットにおける精度と分散の観点で、どの程度優れているか?
  • RQ4IDおよびOODセットの両方に条件付けを行うSCMIバージョンは、SMIやベースライン手法と比較して、複数のアクティブラーニングラウンドにわたってより安定的かつ信頼性の高いパフォーマンスを発揮するか?
  • RQ5ImageNetのような大規模な実世界データセットに対しても、SIMILARは、レアクラスおよびOOD検出シナリオでパフォーマンス向上を維持できるか?

主な発見

  • CIFAR-10およびMNISTにおける稀なクラスを対象としたアクティブラーニングにおいて、SIMILARは既存のベースラインと比較して最大18%高い精度を達成した。
  • 分布外(OOD)データシナリオでは、Badge や Glister-Active といった最先端の手法と比較して、SIMILARは5–10%のパフォーマンス向上を示した。
  • SCMIベースの獲得関数(LogdetcmiおよびFlcmi)は、後続のアクティブラーニングラウンドにおいて、SMIおよびベースライン手法を一貫して上回り、条件付けが強化されるに従い2–3%の改善を示した。
  • SCMI関数は、実行間でのトレーニングパフォーマンスの分散が最小であり、実世界への展開におけるより高いロバスト性と信頼性を示している。
  • SIMILARは、特にOODを多く含む未ラベルセットにおいて、他の手法と比較してより多くの分布内(ID)ポイントを選択しており、ターゲットタスクとの整合性が優れていることを示している。
  • 小規模な検証セットでも強力なパフォーマンスを維持しており、大規模なラベル付き検証セットや事前学習済み表現に依存する手法を上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。