Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Learning Improves Model Robustness Under Label Noise

Aritra Ghosh, Andrew Lan|arXiv (Cornell University)|Apr 19, 2021
Machine Learning and Data Classification参考文献 28被引用数 10
ひとこと要約

本論文は、対照的学習(例:SimCLR)からの表現を初期化することで、画像分類において高レベルのラベルノイズ下でも教師ありロバスト学習手法の性能が著しく向上することを示している。驚くべきことに、SimCLR事前学習を用いる場合、90%の対称的ラベルノイズ下でも、標準的なカテゴリカル交差エントロピー訓練が、DivideMixなどの最先端の半教師あり手法を50%以上上回る性能を発揮する。

ABSTRACT

Deep neural network-based classifiers trained with the categorical cross-entropy (CCE) loss are sensitive to label noise in the training data. One common type of method that can mitigate the impact of label noise can be viewed as supervised robust methods; one can simply replace the CCE loss with a loss that is robust to label noise, or re-weight training samples and down-weight those with higher loss values. Recently, another type of method using semi-supervised learning (SSL) has been proposed, which augments these supervised robust methods to exploit (possibly) noisy samples more effectively. Although supervised robust methods perform well across different data types, they have been shown to be inferior to the SSL methods on image classification tasks under label noise. Therefore, it remains to be seen that whether these supervised robust methods can also perform well if they can utilize the unlabeled samples more effectively. In this paper, we show that by initializing supervised robust methods using representations learned through contrastive learning leads to significantly improved performance under label noise. Surprisingly, even the simplest method (training a classifier with the CCE loss) can outperform the state-of-the-art SSL method by more than 50\% under high label noise when initialized with contrastive learning. Our implementation will be publicly available at {\url{https://github.com/arghosh/noisy_label_pretrain}}.

研究の動機と目的

  • ラベルノイズ下で、教師ありロバスト学習手法が、非ラベルデータを活用して表現を事前学習することで、より高い性能を達成できるかどうかを調査すること。
  • 対照的学習の表現が、高レベルのラベルノイズ下でも一般化性能を向上させる強力なインダクティブバイアスとして機能するかどうかを評価すること。
  • 表現事前学習を用いることで、ラベルノイズ下における教師ありロバスト手法と最先端の半教師あり学習(SSL)手法との性能差を縮められるかどうかを特定すること。
  • 表現学習とノイズ耐性学習を分離することで、ラベルノイズ下での学習のための新しいベースラインを確立すること。
  • 異なる事前学習戦略(SimCLR 対 ImageNet)が、対称的および非対称的ラベルノイズ下でのモデルのロバスト性に与える影響を分析すること。

提案手法

  • 全訓練セット(ノイズありラベルを含む)を用いて、対照的学習(SimCLR)により特徴エンコーダーを事前学習し、ロバストな表現を学習する。
  • 同じノイズありデータセットを用いて、カテゴリカル交差エントロピー(CCE)損失による標準的な教師あり学習を用いて、分類器ヘッドを微調整し、SimCLRで学習した特徴を入力とする。
  • 既存のロバスト損失関数(例:$L_q$ 損失($q=0.66$)、MAE)および重み付け機構(例:MWNet)を、SimCLR特徴の上に適用し、ロバスト性を評価する。
  • 対照的学習の目的関数が効果的に発揮されるように、事前学習中にSimCLRと整合したデータ拡張戦略を採用する。
  • 対称的および非対称的ラベルノイズ設定下で、複数のデータセット(CIFAR-10、CIFAR-100、Clothing1M)における性能を比較する。
  • テスト精度を測定し、クリーンな訓練精度との相対的な性能低下を比較することで、一般化性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1対照的学習による事前学習が、高レベルのラベルノイズ下における標準的な教師あり学習手法のロバスト性を著しく向上させられるか?
  • RQ2SimCLR表現の事前学習により、単純なCCEベースの訓練でさえ、ラベルノイズ下で最先端の半教師あり学習手法を上回れるか?
  • RQ3ロバスト損失関数(例:$L_q$、MAE)および重み付け手法(例:MWNet)の性能は、SimCLR特徴を初期値とする場合とランダム初期化とでどのように変化するか?
  • RQ4クラスオーバーラップが限られている状況において、SimCLR事前学習はImageNet事前学習と比較して、ラベルノイズ下でのロバスト性において優れているか?
  • RQ5表現の質が、ラベルノイズ下における教師ありロバスト手法の画像データセットにおける性能劣化を説明する程度はどの程度か?

主な発見

  • 90%の対称的ラベルノイズ下では、CCE損失にSimCLR初期化を適用した場合、CIFAR-10で82.9%、CIFAR-100で52.11%の精度を達成し、DivideMix(93.2%および31.5%)をそれぞれ9%および65%の絶対的増加で上回った。
  • SimCLR事前学習を適用した場合、$L_q$損失およびMWNet手法は、高ノイズ下で最先端のDivideMix手法を著しく上回った。特に、ランダム初期化では有用な表現が学習できない状況で顕著な優位性を示した。
  • Clothing1Mデータセットでは、ImageNet事前学習と比較して、SimCLR初期化を用いたCCEがテスト精度を6%向上させた。これは、ImageNetとClothing1Mの間でクラスオーバーラップが最小限であるにもかかわらず顕著な改善を示している。
  • 特に対称的ノイズ下では、SimCLR初期化がクリーンな訓練との性能低下をImageNet事前学習よりも効果的に抑制した。
  • INet32(ImageNetのサブセット)で事前学習を行うと、CIFAR-100の精度が81.51%まで向上したが、SimCLR事前学習のみで、大規模事前学習を必要とせずに優れたロバスト性を達成した。
  • 教師ありロバスト手法とSSL手法との性能差は、主に損失関数の本質的制限によるものではなく、表現の質の低さに起因していることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。