[論文レビュー] Centrality and Consistency: Two-Stage Clean Samples Identification for Learning with Instance-Dependent Noisy Labels
本稿では、インスタンス依存ラベルノイズ(IDN)とクラス不均衡を伴う画像分類において、クリーンサンプルを同定する2段階手法を提案する。最初の段階では、エントロピーに基づくレアクラス集約を用いたクラスレベル特徴クラスタリングにより、クラス中心付近の容易なクリーンサンプルを同定する。2番目の段階では、意思決定境界付近の難しいクリーンサンプルを同定するため、一貫性に基づく分類ヘッドを適用する。本手法は、CIFAR-100とClothing1Mでそれぞれ76.08%および75.40%の精度を達成し、SOTA性能を発揮した。
Deep models trained with noisy labels are prone to over-fitting and struggle in generalization. Most existing solutions are based on an ideal assumption that the label noise is class-conditional, i.e., instances of the same class share the same noise model, and are independent of features. While in practice, the real-world noise patterns are usually more fine-grained as instance-dependent ones, which poses a big challenge, especially in the presence of inter-class imbalance. In this paper, we propose a two-stage clean samples identification method to address the aforementioned challenge. First, we employ a class-level feature clustering procedure for the early identification of clean samples that are near the class-wise prediction centers. Notably, we address the class imbalance problem by aggregating rare classes according to their prediction entropy. Second, for the remaining clean samples that are close to the ground truth class boundary (usually mixed with the samples with instance-dependent noises), we propose a novel consistency-based classification method that identifies them using the consistency of two classifier heads: the higher the consistency, the larger the probability that a sample is clean. Extensive experiments on several challenging benchmarks demonstrate the superior performance of our method against the state-of-the-art.
研究の動機と目的
- インスタンス依存ラベルノイズ(IDN)の課題に対処すること。IDNはクラス条件付きノイズよりも現実的ではあるが、より取り扱いが難しい。
- 従来の手法がクラス条件付きノイズを仮定しており、特徴依存ノイズを伴う現実世界のデータでは失敗することを克服すること。
- 特にノイズ分布が著しく歪んでいるデータセットにおいて、クラス間不均衡がクリーンサンプル同定に与える影響を軽減すること。
- IDNとクラス不均衡の下でも、クリーンサンプルを正確に同定することでモデルの一般化性能を向上させること。
- クラスタリングと一貫性に基づく分類を統合した、頑健な学習を可能にする半教師あり学習フレームワークの構築
提案手法
- 段階1では、単位球面上のサンプル特徴とクラス予測中心間のコサイン類似度を用いて、クラスレベル特徴クラスタリングを実行する。
- ガウス・ミックスチャネル(GMM)を用いて、サンプルがクラス中心に近いかどうかを二値化し、中心に近いものをクリーンと同定する。
- クラス不均衡を緩和するため、予測エントロピーを用いて稀少クラスを集約し、代表されないクラスのクラスタリング安定性を向上させる。
- 段階2では、意思決定境界付近の難しいクリーンサンプルを同定するため、2つの並列分類器を備えた一貫性に基づく分類ヘッドを導入する。
- 特徴抽出器に一貫性を促進する正則化項を適用するとともに、分類器に不一致を促進する正則化項を適用し、モデルの頑健性を向上させる。
- 学習後、一貫性スコアに基づいて2度目のGMMを用いてサンプルを分類し、GMMの平均が低いほどクリーンである可能性が高くなる。
実験結果
リサーチクエスチョン
- RQ1インスタンス依存ラベルノイズとクラス不均衡の下でも、2段階的手法がクリーンサンプルを効果的に同定できるか?
- RQ2エントロピーに基づくレアクラス集約を用いたクラスレベル特徴クラスタリングは、不均衡データセットにおけるクリーンサンプル検出をどのように改善するか?
- RQ32つの分類ヘッド間の予測一貫性は、意思決定境界付近の難しいクリーンサンプルの同定をどの程度向上させるか?
- RQ4実世界のノイズありベンチマークにおいて、本手法はSOTA手法と比較して精度と頑健性の面で優れているか?
- RQ5一貫性に基づく段階は、同定されたクリーンセットにおけるクラス分布を効果的にバランスさせるか?
主な発見
- ノイズ比0.6のCIFAR-100では、本手法が76.08%のテスト精度を達成し、SOTAのDivideMix(75.20%)とNGC(74.44%)を上回った。
- 極めて不均衡なClothing1Mデータセットでは、本手法が75.40%の精度を達成し、DivideMix(74.26%)とNGC(74.44%)を上回った。
- アブレーションスタディにより、両段階が顕著に寄与しており、本手法はCE損失ベースラインに対してCIFAR-100で23.72ポイントの精度向上を達成した。
- 一貫性に基づく分類(段階2)により、CIFAR-100におけるノイズあり/クリーンの分類AUCは0.72から0.85に向上し、強力な識別能力を示した。
- 段階2終了後、クリーンセット内のクラス分布がよりバランスが取れるようになり、特に極端なケースでは、レアクラスの割合が増加し、リッチクラスの割合が減少した。
- 確率密度関数の結果から、類似度(段階1)と一貫性(段階2)の両指標が、クリーンサンプルとノイズサンプルを効果的に分離しており、一貫した予測はクリーンサンプルの強力な指標であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。