Skip to main content
QUICK REVIEW

[論文レビュー] SSR: An Efficient and Robust Framework for Learning with Unknown Label Noise

Feng Chen, Georgios Tzimiropoulos|arXiv (Cornell University)|Nov 22, 2021
Machine Learning and Data Classification参考文献 45被引用数 9
ひとこと要約

本論文は、ノイズの種類と度合いが不明な未知のラベルノイズ(LULN)の学習のためのシンプルで堅牢なフレームワーク、SSRを提案する。ノイズの種類と度合いが不明な状況下でも、クリーンなサンプルの選別に非パラメトリックなKNN分類器を用い、反復的なノイズサンプルの再ラベル付けにパラメトリックモデルを用いる。自己教師あり学習や事前学習を用いずに、CIFAR-10/100における合成ノイズおよびWebVision、Clothing1M、ANIMAL-10Nといった実世界のデータセットにおいて、最先端の精度を達成する。

ABSTRACT

Despite the large progress in supervised learning with neural networks, there are significant challenges in obtaining high-quality, large-scale and accurately labelled datasets. In such a context, how to learn in the presence of noisy labels has received more and more attention. As a relatively complex problem, in order to achieve good results, current approaches often integrate components from several fields, such as supervised learning, semi-supervised learning, transfer learning and resulting in complicated methods. Furthermore, they often make multiple assumptions about the type of noise of the data. This affects the model robustness and limits its performance under different noise conditions. In this paper, we consider a novel problem setting, Learning with Unknown Label Noise}(LULN), that is, learning when both the degree and the type of noise are unknown. Under this setting, unlike previous methods that often introduce multiple assumptions and lead to complex solutions, we propose a simple, efficient and robust framework named Sample Selection and Relabelling(SSR), that with a minimal number of hyperparameters achieves SOTA results in various conditions. At the heart of our method is a sample selection and relabelling mechanism based on a non-parametric KNN classifier~(NPK) $g_q$ and a parametric model classifier~(PMC) $g_p$, respectively, to select the clean samples and gradually relabel the noisy samples. Without bells and whistles, such as model co-training, self-supervised pre-training and semi-supervised learning, and with robustness concerning the settings of its few hyper-parameters, our method significantly surpasses previous methods on both CIFAR10/CIFAR100 with synthetic noise and real-world noisy datasets such as WebVision, Clothing1M and ANIMAL-10N. Code is available at https://github.com/MrChenFeng/SSR_BMVC2022.

研究の動機と目的

  • 未知のラベルノイズ下での深層ニューラルネットワークの学習という課題に取り組むこと。ノイズの種類と度合いがいずれも指定されていない状況を想定する。
  • 自己教師あり事前学習や共トレーニングといった複雑なコンポONENTに依存せず、ハイパーパrameter設定に対して頑健な手法を開発すること。
  • ノイズパターンの明示的モデリングを避け、サンプル選別と反復的再ラベル付けを組み合わせることで、ノイズありデータセットにおける一般化性能と精度を向上させること。
  • 対称的・非対称的ノイズ、およびオープンセット・クローズドセットノイズの組み合わせといった多様なノイズ設定において、最先端の性能を達成すること。

提案手法

  • SSRは、k番目の近隣のラベルと整合性を持つサンプルを基に、クリーンなサンプルを特定する非パラメトリックKNN分類器(NPK)を用いる。
  • パラメトリックモデル分類器(PMC)を用いて予測を生成し、高い信頼度の予測に基づいて反復的にノイズのあるサンプルを再ラベル付けする。
  • フレームワークは二段階のプロセスを採用する。第一に、NPKによるクリーンサンプルの選別。第二に、PMCの信頼度の高い予測に基づくノイズサンプルの再ラベル付け。
  • 特徴表現の一貫性を高めるために、オプションとして特徴一貫性損失を適用し、オープンセットノイズに対する耐性を向上させる。
  • モデル共トレーニングや自己教師あり事前学習、自己教師あり学習といった複雑なコンponentsを避け、交差エントロピー損失と反復的精錬に依存する。
  • ハイパーパrameterは最小限で、感度が低く、多様なノイズ条件下でもその値に依存しないことがアブレーションスタディで確認されている。

実験結果

リサーチクエスチョン

  • RQ1未知のラベルノイズの学習において、シンプルなフレームワークが複雑な最先端手法を上回ることができるか?
  • RQ2提案されたサンプル選別と再ラベル付け機構は、未知のノイズ種別と変動するノイズ度合いの下でも効果を発揮するか?
  • RQ3自己教師あり学習や事前学習を用いない場合、実世界のノイズありデータセットにおける性能に悪影響を及えるか?
  • RQ4異なるノイズ設定下で、ハイパーパrameterの選択にどれほど頑健であるか?
  • RQ5既存手法がしばしば失敗する、オープンセットとクローズドセットノイズの組み合わせ状況では、このフレームワークはどのように対処するか?

主な発見

  • CIFAR-10で90%の対称的ノイズを想定した場合、SSRはトップ1精度96.3%を達成し、先行する最先端手法を大きく上回る。
  • CIFAR-100で90%の対称的ノイズを想定した場合、SSRは95.2%の精度を達成し、前回の最良手法を1.5ポイント以上上回る。
  • 挑戦的な組み合わせノイズ設定(0.5のオープンセットノイズ、1.0のクローズドセットノイズ)下で、CIFAR-10ではSSRがトップ1精度95.7%を達成し、EDM(94.0%)とDivideMix(91.8%)を上回る。
  • 実世界のWebVisionデータセットでは、SSR+が80.92%のトップ1精度を達成し、Co-teaching(63.58%)とDivideMix(77.32%)を上回る。
  • ANIMAL-10Nでは、SSR+が88.5%のトップ1精度を達成し、SELFIE(79.4%)、PLC(81.8%)、NCT(83.4%)を上回る。
  • アブレーションスタディにより、SSRがハイパーパrameterの値に頑健で、自己教師あり学習や事前学習なしでも強力な性能を維持することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。