Skip to main content
QUICK REVIEW

[論文レビュー] Consistency-based Semi-supervised Active Learning: Towards Minimizing Labeling Cost

Mingfei Gao, Zizhao Zhang|arXiv (Cornell University)|Oct 16, 2019
Machine Learning and Algorithms参考文献 52被引用数 13
ひとこと要約

本論文は、一貫性正則化を用いて未ラベルデータを活用することで、モデル学習とサンプル選択を統合する一貫性に基づく半教師ありアクティブラーニングフレームワークを提案する。最小限のラベルコストで最先端の性能を達成している。本手法は、データオーグメンテーション間での予測の一貫性を用いて、不確実で情報量の多いサンプルを特定し、CIFAR-10、CIFAR-100、ImageNetにおいて、先行研究のALとSSLの組み合わせを著しく上回っている。

ABSTRACT

Active learning (AL) combines data labeling and model training to minimize the labeling cost by prioritizing the selection of high value data that can best improve model performance. In pool-based active learning, accessible unlabeled data are not used for model training in most conventional methods. Here, we propose to unify unlabeled sample selection and model training towards minimizing labeling cost, and make two contributions towards that end. First, we exploit both labeled and unlabeled data using semi-supervised learning (SSL) to distill information from unlabeled data during the training stage. Second, we propose a consistency-based sample selection metric that is coherent with the training objective such that the selected samples are effective at improving model performance. We conduct extensive experiments on image classification tasks. The experimental results on CIFAR-10, CIFAR-100 and ImageNet demonstrate the superior performance of our proposed method with limited labeled data, compared to the existing methods and the alternative AL and SSL combinations. Additionally, we study an important yet under-explored problem -- "When can we start learning-based AL selection?". We propose a measure that is empirically correlated with the AL target loss and is potentially useful for determining the proper starting point of learning-based AL methods.

研究の動機と目的

  • 半教師あり学習を用いて未ラベルデータをトレーニングプロセスに統合することで、アクティブラーニングにおけるラベルコストを最小化すること。
  • 学習ベースのアクティブラーニングにおけるコールドスタート問題に対処するため、最適な初期ラベル付きデータセットサイズを決定するデータ駆動型基準を提案すること。
  • 選択メトリックをSSLトレーニング目的と一致させることで、サンプル選択とモデルトレーニングを統合すること。
  • 一貫性に基づくメトリックを開発し、サンプル選択における不確実性と多様性を暗黙的にバランスさせること。

提案手法

  • ラベル付きデータと未ラベル付きデータの両方をトレーニング中に使用する半教師あり学習フレームワークを採用し、データオーグメンテーション間での一貫性を促進する一貫性ベースの損失関数を導入する。
  • 同じサンプルのオリジナル版とオーグメント済み版の間の予測の不一致度を測定することで、未ラベル付きサンプルを評価する一貫性ベースの選択メトリックを提案する。
  • 一貫性スコアが低い(=不確実性や曖昧さが高いため)サンプルを人間によるラベリングの対象として選択し、モデル性能の向上に最も寄与すると予想される。
  • ラベル付きデータには交差エントロピー損失、未ラベル付きデータには一貫性損失を適用し、各トレーニングサイクルで両目的を同時に最適化する。
  • 予測分布と真のラベル分布の間の交差エントロピー H[p(Y), p(Ŷ)] を用いた新たな測定値を導入し、アクティブラーニングのターゲット損失を推定し、開始サイズの選定を支援する。
  • ベースとなるSSLモデルにMixMatchを用い、CIFAR-10、CIFAR-100、ImageNetを含む複数のデータセットで手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1半教師あり学習による未ラベルデータの統合が、ラベルコストを削減しつつモデル性能を向上させることができるか?
  • RQ2SSLトレーニング目的と整合性を持つ一貫性ベースのメトリックをどのように設計し、効果的に情報量の多いサンプルを選択できるか?
  • RQ3コールドスタート問題を軽減するための、信頼性がありラベル効率の良い最適な開始サイズを決定する方法は何か?
  • RQ4標準的なALとSSLの組み合わせと比較して、本手法の性能とラベル効率はどの程度か?

主な発見

  • 提案手法は、既存のALおよびSSLベースラインと比較して、はるかに少ないラベル付きサンプルでCIFAR-10、CIFAR-100、ImageNetで最先端の性能を達成した。
  • CIFAR-10では、合計3000件のラベル付きサンプルで82.75%の精度に到達し、同じ条件下でエントロピーに基づく選択(82.67%)やk-center選択(81.70%)を上回った。
  • 一貫性ベースの選択メトリックは、不確実性と多様性の両方を暗黙的にバランスさせていることが、定性的および定量的分析によって裏付けられた。
  • H[p(Y), p(Ŷ)] を用いた提案された測定値は、真のアクティブラーニングターゲット損失と強い実証的相関を示し、追加のラベルなしで最適な開始サイズを効果的に推定可能であることを示した。
  • CIFAR-10では、初期ラベル付きデータセットを100~150件に設定すると最適であり、H[p(Y), p(Ŷ)] の値がこの時点で安定化し、さらなる拡大による利得が小さくなることが示された。
  • 本手法は低データレジームでも頑健であり、より早期かつより情報に基づいたサンプル選択を可能にすることで、コールドスタート問題を効果的に緩和した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。