Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Self-Supervised Re-labeling Approach for Training with Noisy Labels

Devraj Mandal, Shrisha Bharadwaj|arXiv (Cornell University)|Oct 13, 2019
Machine Learning and Data Classification参考文献 35被引用数 4
ひとこと要約

本稿では、ノイズのあるラベルで学習する深層学習の性能を向上させるために、自己教師あり対照的特徴学習を最初に行い、その後2つの並列ネットワークから得られる小損失サンプルを用いて高損失サンプルを再ラベル化する、mCT-S2Rと呼ばれる新しい自己教師あり再ラベル化フレームワークを提案する。この手法は、MNIST、CIFAR-10、CIFAR-100において高ノイズレベル下でも最先端の手法を著しく上回り、再ラベル化後は単一ネットワークでの学習により計算コストを低減する。

ABSTRACT

The major driving force behind the immense success of deep learning models is the availability of large datasets along with their clean labels. Unfortunately, this is very difficult to obtain, which has motivated research on the training of deep models in the presence of label noise and ways to avoid over-fitting on the noisy labels. In this work, we build upon the seminal work in this area, Co-teaching and propose a simple, yet efficient approach termed mCT-S2R (modified co-teaching with self-supervision and re-labeling) for this task. First, to deal with significant amount of noise in the labels, we propose to use self-supervision to generate robust features without using any labels. Next, using a parallel network architecture, an estimate of the clean labeled portion of the data is obtained. Finally, using this data, a portion of the estimated noisy labeled portion is re-labeled, before resuming the network training with the augmented data. Extensive experiments on three standard datasets show the effectiveness of the proposed framework.

研究の動機と目的

  • ウェブやクラウドソーシングから得られる大規模データセットにおいて一般的に見られるノイズのあるラベルを前提とした深層ニューラルネットワークの学習課題に対処すること。
  • ノイズ遷移行列の事前知識に依存せずに、一般化性能を向上させるとともにノイズラベルへの過学習を低減すること。
  • co-teachingとは異なり、学習全体を通じて2つのネットワークを維持する必要がない、計算コストが低い手法を開発すること。
  • 自己教師あり事前学習と、小損失インスタンスのクラス平均を用いた高損失サンプルの動的再ラベル化を組み合わせることで、モデルの耐性を向上させること。

提案手法

  • ラベルを一切使用せずに、ノイズに頑健で不変な特徴を学習できるように、自己教師あり対照的学習目的(例:インスタンス識別)を用いてネットワークを事前学習する。
  • co-teachingに類似した設定で2つの並列ネットワークを学習し、小損失サンプルを特定する。小損失サンプルは、より正しくラベル付けされている可能性が高いと仮定する。
  • 小損失サンプルの特徴からクラス平均を計算し、再ラベル化のための基準プロトタイプとして用いる。
  • クラスプロトタイプとの類似度に基づいて高損失サンプルを再ラベル化する。信頼性の高い再ラベル化のみを、ソフトマックス確率の信頼度しきい値によって選択する。
  • 再ラベル化後の高損失サンプルと元の小損失サンプルを組み合わせて、単一ネットワークで再学習を再開し、一般化性能を向上させる。
  • 学習の進行に伴い、クリーンデータに焦点を当てるために、ドロップレート R(T) = 1−ε·min(T/Tk, 1) を動的に調整する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり事前学習は、画像分類においてノイズラベルへの過学習を低減し、特徴の耐性を向上させることができるか?
  • RQ2小損失サンプルから導出されたクラス平均を用いて高損失サンプルを再ラベル化することで、高ノイズレベル下でもモデルの精度が向上するか?
  • RQ32つのネットワークを用いてクリーンサンプルを特定した後、単一ネットワークでのファインチューニングを実施するアプローチは、性能を維持しながら計算コストを削減できるか?
  • RQ4信頼度しきい値(κ)や更新頻度(T_update)といったハイパーパrameterの変動に対して、この手法はどれほど耐性を示すか?
  • RQ5対称的ノイズ、ペア-20%、ペア-45%といった異なるノイズモデルや、MNIST、CIFAR-10、CIFAR-100といった異なるデータセットに対しても、このフレームワークは汎用性を示せるか?

主な発見

  • 対称的ノイズが50%のMNISTでは、mCT-S2Rが98.86%のテスト精度を達成し、ベースラインを上回り、ハイパーパrameter設定の変更に対しても高い一貫性を示した。
  • 対称的ノイズが50%のCIFAR-100では、mCT-S2Rが60.49%の精度を達成し、同じノイズ環境下で最先端の手法を著しく上回った。
  • 信頼度しきい値(κ = 0.80, 0.90, 0.95)の異なる設定においても、本手法は安定した性能を維持しており、ハイパーパrameter選択に対する耐性が確認された。
  • 再ラベル化を実行するネットワークの選択にかかわらず、テスト精度の差が0.3%未満にとどまり、手法の選択に依存しない安定性を示した。
  • 真のノイズレベルεを事前に知らない状況下でも、安定した性能(例:45%ペアノイズのMNISTでは94.72%)を達成しており、実用的であることが示された。
  • 再ラベル化後に単一ネットワークでの学習に移行するため、co-teachingが学習全体で2つのネットワークを維持するのとは異なり、計算コストを削減できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。