Skip to main content
QUICK REVIEW

[論文レビュー] PropMix: Hard Sample Filtering and Proportional MixUp for Learning with Noisy Labels

Filipe R. Cordeiro, Vasileios Belagiannis|arXiv (Cornell University)|Oct 22, 2021
Machine Learning and Data Classification被引用数 6
ひとこと要約

PropMixは、難易度の高い誤りのあるラベル付きサンプルをフィルタリングし、割合に応じたMixUpを用いて耐性を高める、ノイズラベル学習のための新しい訓練フレームワークを提案する。容易なノイズラベル付きサンプルを再ラベルし、統一されたセットでMixUpを適用することで、CIFAR-10/100、WebVision、Red Mini-ImageNetで最先端の性能を達成し、特に高いノイズ率下でも顕著に優れた性能を発揮する。

ABSTRACT

The most competitive noisy label learning methods rely on an unsupervised classification of clean and noisy samples, where samples classified as noisy are re-labelled and "MixMatched" with the clean samples. These methods have two issues in large noise rate problems: 1) the noisy set is more likely to contain hard samples that are in-correctly re-labelled, and 2) the number of samples produced by MixMatch tends to be reduced because it is constrained by the small clean set size. In this paper, we introduce the learning algorithm PropMix to handle the issues above. PropMix filters out hard noisy samples, with the goal of increasing the likelihood of correctly re-labelling the easy noisy samples. Also, PropMix places clean and re-labelled easy noisy samples in a training set that is augmented with MixUp, removing the clean set size constraint and including a large proportion of correctly re-labelled easy noisy samples. We also include self-supervised pre-training to improve robustness to high noisy label scenarios. Our experiments show that PropMix has state-of-the-art (SOTA) results on CIFAR-10/-100(with symmetric, asymmetric and semantic label noise), Red Mini-ImageNet (from the Controlled Noisy Web Labels), Clothing1M and WebVision. In severe label noise bench-marks, our results are substantially better than other methods. The code is available athttps://github.com/filipe-research/PropMix.

研究の動機と目的

  • ノイズラベル付き半教師あり学習において、誤って再ラベルされた難易度の高いノイズサンプルへの過学習の課題に対処すること。
  • 特に高いノイズ率下で制限を受けるクリーンデータセットのサイズに縛られるMixMatchの限界を克服すること。
  • 難易度の高いノイズサンプルをフィルタリングし、容易なノイズサンプルを正しく再ラベルすることにより、高いノイズ環境下でのモデルの耐性を向上させること。
  • 再ラベルされたサンプルに対して交差エントロピー損失のみを用いることで、複雑な損失関数やハイパーパrameterへの依存を低減すること。
  • 主な訓練段階の前段階で自己教師あり事前学習を実施し、特徴表現とモデルの信頼性を向上させること。

提案手法

  • PropMixは2段階のフィルタリングプロセスを採用する:まず損失値を用いてサンプルをクリーンまたはノイズありと分類し、次に分類の信頼性が低い難易度の高いノイズサンプルを削除する。
  • 容易なノイズサンプルはモデルの予測値を用いて再ラベルされ、クリーンサンプルと共に訓練セットに統合される。
  • 統合された訓練セットはMixUpにより拡張され、クリーンサンプルと再ラベルされた容易なノイズサンプル間で割合に応じた混合が可能となり、クリーンデータセットのサイズ制約が解消される。
  • 主な訓練フェーズの前段階で、特徴表現とモデルの信頼性を向上させるためにSCANを用いた自己教師あり事前学習を実施する。
  • 最終段階の訓練では、フィルタリングおよび拡張された訓練セットに対してのみ交差エントロピー損失を用いることで、訓練パイプラインの簡素化とハイパーパrameterへの感受性の低減を実現する。
  • 再ラベルされたサンプルに対して平均絶対誤差(MAE)損失を使用しないが、容易なサンプルの再ラベル精度が高いため、CE損失のみで効果的な学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1難易度の高いノイズサンプルをフィルタリングすることで、過学習を低減し、ノイズラベル学習における再ラベル精度を向上させることができるか?
  • RQ2MixMatchにおけるクリーンデータセットサイズの制約を解除することで、高いノイズ率下でも性能が向上するか?
  • RQ3フィルタリングおよび再ラベルされたサンプルに対して単純な交差エントロピー損失が、MAEなどのより複雑な損失関数を上回る性能を発揮するか?
  • RQ4自己教師あり事前学習は、難易度の高いサンプルのフィルタリングとMixUpを組み合わせた場合、ノイズラベル学習における耐性をどのように向上させるか?
  • RQ5PropMixは、対称的・非対称的・意味的ラベルノイズを含むベンチマークにおいて、既存の最先端手法をどの程度上回るか?

主な発見

  • 90%の対称的ノイズを伴うCIFAR-10では、PropMixはトップ1精度78.84%を達成し、前回の最先端手法DivideMix(77.78%)を1.06ポイント上回った。
  • 90%の対称的ノイズを伴うCIFAR-100では、PropMixはトップ1精度94.9%を達成し、DivideMix(93.4%)および他のベースラインを顕著に上回った。
  • 80%のラベルノイズを伴うRed Mini-ImageNetでは、PropMixはトップ1精度61.24%を達成し、次に優れた手法(FaMUS 51.42%)に対して顕著な改善を示した。
  • 80%のノイズを伴うWebVisionでは、PropMixはトップ1精度43.42%を達成し、DivideMix(34.50%)およびFaMUS(35.50%)を8ポイント以上上回った。
  • アブレーションスタディでは、再ラベルされたサンプルに対してMAE損失をCE損失に置き換えても、PropMixは高い性能を維持した。これは、容易なサンプルの再ラベルが正確であれば、CE損失のみで十分に高性能な学習が可能であることを示している。
  • 複雑な損失関数や広範なハイパーパramータチューニングに依存せず、あらゆるベンチマークで最先端の結果を達成した。これは、本手法の耐性とシンプルさを強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。