Skip to main content
QUICK REVIEW

[論文レビュー] Self-Filtering: A Noise-Aware Sample Selection for Label Noise with Confidence Penalization

Qi Wei, Haoliang Sun|arXiv (Cornell University)|Aug 24, 2022
Machine Learning and Data Classification被引用数 5
ひとこと要約

本論文では、ラベルノイズの学習におけるノイズに配慮したサンプル選択手法 Self-Filtering (SFT) を提案する。SFT は、歴史的なモデル予測の変動を用いてノイズのあるサンプルを特定・フィルタリングするとともに、境界例を保持する。記憶バンクを用いて予測を追跡し、信頼度ペナルティ正則化を組み合わせることで、さまざまなノイズタイプの複数のベンチマークで最先端の性能を達成し、著しく高い耐性と一般化性能を実現する。

ABSTRACT

Sample selection is an effective strategy to mitigate the effect of label noise in robust learning. Typical strategies commonly apply the small-loss criterion to identify clean samples. However, those samples lying around the decision boundary with large losses usually entangle with noisy examples, which would be discarded with this criterion, leading to the heavy degeneration of the generalization performance. In this paper, we propose a novel selection strategy, extbf{S}elf- extbf{F}il extbf{t}ering (SFT), that utilizes the fluctuation of noisy examples in historical predictions to filter them, which can avoid the selection bias of the small-loss criterion for the boundary examples. Specifically, we introduce a memory bank module that stores the historical predictions of each example and dynamically updates to support the selection for the subsequent learning iteration. Besides, to reduce the accumulated error of the sample selection bias of SFT, we devise a regularization term to penalize the confident output distribution. By increasing the weight of the misclassified categories with this term, the loss function is robust to label noise in mild conditions. We conduct extensive experiments on three benchmarks with variant noise types and achieve the new state-of-the-art. Ablation studies and further analysis verify the virtue of SFT for sample selection in robust learning.

研究の動機と目的

  • 小損失に基づくサンプル選択の限界に対処する。これは、高い損失により境界例が除外され、選択バイアスが生じるためである。
  • 従来の手法における固定損失閾値の感度およびスケーラビリティの問題を克服する。
  • 意思決定境界学習に不可欠な境界サンプルを保持することで、モデルの一般化性能を向上させる。
  • 反復学習における選択バイアスの蓄積を低減するため、信頼度ペナルティ正則化項を導入する。
  • 多様なノイズ設定および学習パラダイム(半教師あり学習を含む)において、フレームワークの有効性と汎用性を示す。

提案手法

  • 各訓練サンプルの複数の訓練ステップにわたる歴史的予測を格納する記憶バンクモジュールを導入する。
  • 変動基準を定義する:連続する訓練ステップで予測が正しく・誤っての間を繰り返す場合、そのサンプルはノイズがあるとマークされる。
  • ノイズサンプルでは頻繁な入れ替え、クリーンサンプルでは安定した予測という変動パターンを基に、サンプル選択を行う。
  • 反復的な選択を可能にするために、訓練中に記憶バンクを動的に更新する。
  • 誤分類クラスの損失重みを増加させる信頼度ペナルティ正則化項を設計し、過信を軽減し、選択バイアスを緩和する。
  • FixMatch と統合して半教師あり学習に適用し、未ラベルデータおよび除外されたノイズサンプルを活用して性能をさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1歴史的予測の変動は、特に小損失基準によって除外されがちな境界例を含め、ノイズサンプルとクリーンサンプルを信頼性高く区別できるか?
  • RQ2提案された変動に基づく選択戦略は、従来の小損失または投票ベースの選択と比較して、境界サンプルの保持および一般化性能の向上にどの程度寄与するか?
  • RQ3反復学習におけるノイズラベルを伴う訓練において、信頼度ペナルティが選択バイアスの蓄積をどの程度軽減するか?
  • RQ4本フレームワークは、ノイズタイプ(対称的、非対称的)およびノイズ比が変化する状況でもどの程度頑健か?
  • RQ5本フレームワークは、既存の半教師あり学習手法と効果的に統合可能であり、ノイズのあるデータセットにおける性能向上に寄与するか?

主な発見

  • CIFAR-10 において 40% の対称的ラベルノイズ下で、SFT は 92.15% のテスト精度を達成し、先行手法を上回る最先端の性能を示した。
  • CIFAR-100 において 40% の対称的ノイズ下では、SFT は 69.34% のテスト精度を達成し、高ノイズレベル下でも強い耐性を示した。
  • アブレーションスタディでは、信頼度ペナルティ項を削除すると、40% のノイズ下で平均してテスト精度が 3.72% 減少した。これは、選択バイアスの緩和にその項が果たす役割を確認するものである。
  • 多数決と比較して、変動基準を用いたサンプル選択の F スコアが顕著に向上し、クリーンサンプルの識別精度が向上した。
  • 選択された訓練サブセットのサイズが、図 10 の水平基準線に近づくことから、実際のクリーンサンプル数に近いことが示された。
  • 最適な記憶バンクサイズは T=3 であり、それ以上のサイズでは境界サンプルの過剰なフィルタリングにより性能が低下した。これは、アブレーションによる設計選択の妥当性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。