Skip to main content
QUICK REVIEW

[論文レビュー] Robust Data Pruning under Label Noise via Maximizing Re-labeling Accuracy

Dongmin Park, Seola Choi|arXiv (Cornell University)|Nov 2, 2023
Music and Audio Processing被引用数 4
ひとこと要約

本稿では、ラベルノイズ下での再ラベル付け精度を向上させるために、近傍の信頼度を最大化することで訓練サブセットを選択する新規なデータプルーニング手法Prune4ReLを提案する。近傍の予測信頼度を高める例を優先することで、ベースライン比最大9.1%の再ラベル付け性能向上と、ノイズのあるデータセット上での一般化性能最大21.6%の向上を達成する。

ABSTRACT

Data pruning, which aims to downsize a large training set into a small informative subset, is crucial for reducing the enormous computational costs of modern deep learning. Though large-scale data collections invariably contain annotation noise and numerous robust learning methods have been developed, data pruning for the noise-robust learning scenario has received little attention. With state-of-the-art Re-labeling methods that self-correct erroneous labels while training, it is challenging to identify which subset induces the most accurate re-labeling of erroneous labels in the entire training set. In this paper, we formalize the problem of data pruning with re-labeling. We first show that the likelihood of a training example being correctly re-labeled is proportional to the prediction confidence of its neighborhood in the subset. Therefore, we propose a novel data pruning algorithm, Prune4Rel, that finds a subset maximizing the total neighborhood confidence of all training examples, thereby maximizing the re-labeling accuracy and generalization performance. Extensive experiments on four real and one synthetic noisy datasets show that \algname{} outperforms the baselines with Re-labeling models by up to 9.1% as well as those with a standard model by up to 21.6%.

研究の動機と目的

  • 既存の手法が再ラベル付け能力を考慮しないノイズラベル状況におけるデータプルーニングのギャップを埋める。
  • 一般化の向上だけでなく、すべての例の再ラベル付け精度を最大化する訓練サブセットの選択という、新たな問題を形式化する。
  • 完全なモデル学習の前段階で再ラベル付け可能性を推定するという課題を克服する。
  • ノイズのあるラベルの自己補正を向上させるために、全近傍信頼度の合計を最大化するサブセットを特定する、効率的でスケーラブルな手法を開発する。

提案手法

  • 再ラベル付け可能性の代理指標として、選択サブセット内の近傍からの予測信頼度の合計である「縮小近傍信頼度」の概念を導入する。
  • 理論的および実験的に、高い近傍信頼度は正しい再ラベル付けの可能性が高まることを裏付ける。
  • 全訓練例にわたる近傍信頼度カバレッジの合計を最大化するプルーニング目的関数を定式化する。
  • 全近傍信頼度に最も寄与する例を反復的に追加するグリーディ選択アルゴリズムを設計する。
  • サブセット選択中にモデルを再学習しないことでスケーラビリティを最適化し、ImageNet-Nのような大規模データセットへの適用を可能にする。
  • SOP+など最先端の再ラベル付けモデルと統合し、ノイズ下でのエンドツーエンド性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1選択サブセット内の近傍信頼度は、ノイズのある例の正しい再ラベル付けの可能性を予測できるか?
  • RQ2一般化の向上だけでなく再ラベル付け精度を最大化するサブセットを優先するように、データプルーニングを再定式化できるか?
  • RQ3全検索や完全なモデル学習なしに、このようなサブセットを効率的かつスケーラブルに特定できるか?
  • RQ4近傍信頼度を最大化することで、ラベルノイズ下での再ラベル付け精度および下流モデル性能に測定可能な向上が得られるか?

主な発見

  • Prune4ReLは、4つの実際のノイズラベルデータセット(CIFAR-10N、CIFAR-100N、WebVision、Clothing-1M)において、再ラベル付けモデルと組み合わせた場合、8つのデータプルーニングベースラインを最大9.1%上回るテスト精度を達成する。
  • 20%の合成ラベルノイズを含むImageNet-Nでは、選択比が0.05から0.4の範囲で、ベースライン比最大8.6%高い精度を達成する。
  • 選択サブセット内の非自己補正可能なノイズ例の割合を低減し、CIFAR-10N(Random)では90.3%の正しい再ラベル付けを達成する(Forgetは61.7%、kCenterは75.2%)。
  • 低選択比(例:0.05)でも高い性能を維持しており、スケーラビリティとロバスト性を示している。
  • ノイズのあるデータセットにおいて、Prune4ReLと再ラベル付けモデルを組み合わせた場合、標準的なプルーニングベースラインを最大21.6%上回る精度向上を達成する。
  • グリーディアルゴリズムは、120万例のImageNet-Nのような大規模データセットに対しても効率的にスケーリング可能であり、計算上の実現可能性を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。