Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Self-Supervised Pretraining Without Using Labels

Colorado Reed, Sean L. Metzger|arXiv (Cornell University)|Sep 16, 2020
Generative Adversarial Networks and Image Synthesis参考文献 31被引用数 6
ひとこと要約

この論文では、ラベルなしのデータを用いて最適な増幅ポリシーを選択するための自己教師あり評価指標として画像回転予測を提案する。さまざまな設定において、回転予測性能と下流の教師あり精度の間で強い相関(>0.94の順位相関)を示しており、ラベルに依存しないハイパーパramータチューニングが可能であり、ラベル依存手法と同等の性能を達成する。

ABSTRACT

A common practice in unsupervised representation learning is to use labeled data to evaluate the learned representations - oftentimes using the labels from the unlabeled training dataset. This supervised evaluation is then used to guide the training process, e.g. to select augmentation policies. However, supervised evaluations may not be possible when labeled data is difficult to obtain (such as medical imaging) or ambiguous to label (such as fashion categorization). This raises the question: is it possible to evaluate unsupervised models without using labeled data? Furthermore, is it possible to use this evaluation to make decisions about the training process, such as which augmentation policies to use? In this work, we show that the simple self-supervised evaluation task of image rotation prediction is highly correlated with the supervised performance of standard visual recognition tasks and datasets (rank correlation > 0.94). We establish this correlation across hundreds of augmentation policies and training schedules and show how this evaluation criteria can be used to automatically select augmentation policies without using labels. Despite not using any labeled data, these policies perform comparably with policies that were determined using supervised downstream tasks. Importantly, this work explores the idea of using unsupervised evaluation criteria to help both researchers and practitioners make decisions when training without labeled data.

研究の動機と目的

  • ラベル付きデータが入手不可能または不切実な状況において、自己教師あり表現の評価をどう行うかという課題に対処すること。
  • 無教師評価指標が、データ増幅ポリシーの選択を信頼性を持って導けるかどうかを調査すること。
  • 回転予測が表現学習における下流性能の代理指標として機能できるかどうかを特定すること。
  • 自己教師あり学習パイプラインにおけるラベルフリーの自動的でハイパーパramータ探索を可能にすること。

提案手法

  • 入力画像に適用された回転角度を予測するタスクとして、画像回転予測を自己教師あり評価タスクとして用いる。
  • 異なる増幅ポリシーを用いて複数の自己教師ありモデルを学習し、その回転予測精度を測定する。
  • 標準ベンチマーク上で、下流の教師あり精度と照らし合わせて、数百万の学習設定において回転予測性能の相関を評価する。
  • ラベルにアクセスせずに、回転予測スコアを代理指標として用い、最良の増幅ポリシーを選択する。
  • 選択されたポリシーを下流タスクで評価し、ラベルに基づく選択と比較してその性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1回転予測は、自己教師あり表現学習における下流の教師あり性能の信頼できる代理指標として機能できるか?
  • RQ2多様な増幅ポリシーおよび学習スケジュールにおいて、回転予測精度と下流精度の相関はどの程度強いのか?
  • RQ3ラベルにアクセスできない状況でも、回転予測を用いて最適なデータ増幅ポリシーを自動的に選択できるか?
  • RQ4ラベルフリーの選択に回転予測を用いることで、ラベルに基づく選択手法と同等の性能が得られるか?

主な発見

  • 回転予測性能は、数百万の学習設定において、下流の教師あり精度と0.94以上の順位相関を示す。
  • 提案されたラベルフリーの評価手法は、教師あり下流タスクを用いた選択と同等の性能を達成する増幅ポリシーを的確に特定できた。
  • 本手法は、ラベルが不足している、あるいは曖昧な状況においても、ラベルなしで効果的なハイパーパramータ探索とモデル選択を可能にする。
  • 回転予測と下流性能の相関は、多様なデータセットおよび学習スケジュールにおいて一貫して成立する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。