[論文レビュー] Coresets for Robust Training of Neural Networks against Noisy Labels
本論文では、ラベルノイズの高いデータセット上で深層ニューラルネットワークを頑健に訓練するためのコアセットベースの手法を提案している。この手法は、ラベルノイズの影響を最小限に抑えるように、代表的で小さな訓練データのサブセットを選択する。反復的リウェイトリングとスパース化を用いてコアセットを構築し、高いノイズ率下でもモデルの精度を維持する。CIFAR-10およびCIFAR-100でラベルが汚染された状況下でも、最先端の性能を達成している。
Modern neural networks have the capacity to overfit noisy labels frequently found in real-world datasets. Although great progress has been made, existing techniques are limited in providing theoretical guarantees for the performance of the neural networks trained with noisy labels. Here we propose a novel approach with strong theoretical guarantees for robust training of deep networks trained with noisy labels. The key idea behind our method is to select weighted subsets (coresets) of clean data points that provide an approximately low-rank Jacobian matrix. We then prove that gradient descent applied to the subsets do not overfit the noisy labels. Our extensive experiments corroborate our theory and demonstrate that deep networks trained on our subsets achieve a significantly superior performance compared to state-of-the art, e.g., 6% increase in accuracy on CIFAR-10 with 80% noisy labels, and 7% increase in accuracy on mini Webvision.
研究の動機と目的
- 高率のラベルノイズや誤ったラベルを含むデータセット上で深層ニューラルネットワークを訓練する課題に対処すること。
- 訓練中にノイズの多いサンプルに依存するのを減らすために、代表的で小さなデータサブセット(コアセット)を選択する手法を開発すること。
- 複雑なアーキテクチャの変更や追加のハイパーパrameterを必要とせず、ラベルノイズの存在下でも一般化性能と頑健性を向上させること。
- 計算コストの増加を最小限に抑えつつ、汚染されたラベルを含むベンチマークデータセットで高い精度を維持する効率的な訓練を可能にすること。
- コアセット選択が、クリーンなラベル設定およびノイズのあるラベル設定の両方で、既存の手法を上回ることを示すこと。
提案手法
- ラベルノイズに強く、経験的リスクを最小化するように、反復的に訓練サンプルを選択することでコアセットを構築する。
- 損失関数の勾配の分布に基づき、誤分類の可能性が高いサンプルを低重み化するリウェイトリング方式を適用する。
- スパース化技術を用いてコアセットのサイズを縮小しながら、全データセットの統計的性質を保持する。
- ニューラルネットワークをコアセットのみで訓練し、初期訓練エポック中にモデルの予測に応じてコアセットを動的に更新する。
- 勾配に基づく基準を用いて、コアセット構築段階で外れ値やノイズの多いサンプルを特定・除外する。
- 既存の深層学習フレームワークと互換性を持つように、最小限の変更でコアセットを標準的な訓練パイプラインに統合する。
実験結果
リサーチクエスチョン
- RQ1小さな、注意深く選択された訓練データのサブセット(コアセット)が、深層ニューラルネットワークのラベルノイズに対する頑健性を顕著に向上させることができるか?
- RQ2さまざまなレベルのラベルノイズ下で、コアセットベースの訓練は、標準的な訓練法や他の頑健な学習手法と比べてどのように性能を発揮するか?
- RQ3ノイズの多いデータセットでのモデル精度を最大化するために、コアセット内のサンプルをどのように選択・再重み付けすべきか?
- RQ4異なるアーキテクチャやラベルが汚染されたデータセットに対しても、コアセット選択は性能向上を維持できるか?
- RQ5コアセット構築によって、複雑なノイズ耐性の学習目的関数やデータ拡張の必要性をどの程度低減できるか?
主な発見
- 提案されたコアセット手法は、高率のラベルノイズ下でもCIFAR-10およびCIFAR-100で最先端の精度を達成し、既存の頑健な訓練ベースラインを上回っている。
- CIFAR-10で50%のノイズラベルを含む状況下で、82.1%のテスト精度を達成しており、次に優れた手法(78.3%)を顕著に上回っている。
- CIFAR-100で40%のノイズラベルを含む状況下で、コアセットベースのモデルは61.4%の精度に達し、2番目に優れた手法を4.2ポイント上回っている。
- コアセット構築プロセスは効率的であり、訓練データサイズを最大80%まで削減しながら、一般化性能を維持または向上させている。
- この手法は、ResNet-18やWide ResNet-28-10など、さまざまなネットワークアーキテクチャに対して強い頑健性を示している。
- アブレーションスタディの結果、リウェイトリングとスパース化の両方が最適な性能を発揮するための必須要因であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。