[論文レビュー] Is your noise correction noisy? PLS: Robustness to label noise with two stage detection
本稿では、誤りのある疑似ラベルを、疑似ラベルの正しさと強く相関する新しい指標「疑似損失(pseudo-loss)」を用いてフィルタリングすることで、ラベルノイズに対する耐性を向上させる二段階手法である疑似損失選択(PLS)を提案する。動的ダウンウェイトによる低信頼度補正の処理と、信頼度に従ったコントラスト学習目的関数を組み合わせることで、合成データおよび実世界のノイズありデータセットにおいて、現在の最先端(SOTA)の性能を達成し、分布内および分布外のノイズ設定の両方で既存手法を上回る。
Designing robust algorithms capable of training accurate neural networks on uncurated datasets from the web has been the subject of much research as it reduces the need for time consuming human labor. The focus of many previous research contributions has been on the detection of different types of label noise; however, this paper proposes to improve the correction accuracy of noisy samples once they have been detected. In many state-of-the-art contributions, a two phase approach is adopted where the noisy samples are detected before guessing a corrected pseudo-label in a semi-supervised fashion. The guessed pseudo-labels are then used in the supervised objective without ensuring that the label guess is likely to be correct. This can lead to confirmation bias, which reduces the noise robustness. Here we propose the pseudo-loss, a simple metric that we find to be strongly correlated with pseudo-label correctness on noisy samples. Using the pseudo-loss, we dynamically down weight under-confident pseudo-labels throughout training to avoid confirmation bias and improve the network accuracy. We additionally propose to use a confidence guided contrastive objective that learns robust representation on an interpolated objective between class bound (supervised) for confidently corrected samples and unsupervised representation for under-confident label corrections. Experiments demonstrate the state-of-the-art performance of our Pseudo-Loss Selection (PLS) algorithm on a variety of benchmark datasets including curated data synthetically corrupted with in-distribution and out-of-distribution noise, and two real world web noise datasets. Our experiments are fully reproducible github.com/PaulAlbert31/SNCF
研究の動機と目的
- 誤った疑似ラベルがモデル性能を低下させる確認バイアスの問題に起因する、ラベルノイズ補正における重要なギャップを埋めること。
- 二段階ラベルノイズ軽減パイプラインにおける疑似ラベル補正の精度を向上させること。
- 従来の半教師付き手法で用いられる信頼度閾値を上回る、正しい疑似ラベルを特定する信頼性の高い指標を開発すること。
- 疑似ラベルの信頼性に応じて教師あり学習と教師なし学習の間を適応的に切り替えるコントラスト学習目的関数を設計すること。
- 多様なノイズタイプを有する、合成された破損データセットおよび実世界のWebクロールデータセットの両方で、手法の有効性を検証すること。
提案手法
- 疑似ラベルの正しさの確率を定量化する新しい指標「疑似損失」を提案し、実際の正しさと強い相関を示すことを確認した。
- 疑似損失を用いて、低信頼度の疑似ラベルに対する学習更新を動的にダウンウェイトすることで、最適化プロセス中の確認バイアスを軽減した。
- 信頼度に従って補間されたコントラスト損失を導入し、信頼性の高い疑似ラベルに対しては教師ありコントラスト学習、信頼性の低いものに対しては教師なしコントラスト学習を統合した。
- 二段階フレームワークを採用:まず既存手法を用いてノイズのあるサンプルを検出し、次に疑似損失を用いて誤った補正をフィルタリングする。
- 最初の段階で訓練損失の混合モデルを用いてノイズのあるサンプルを検出し、その後一貫性正則化を用いて疑似ラベルを生成した。
- 交差エントロピー分類と補間されたコントラスト損失を統合した目的関数を用いてニューラルネットワークを訓練し、耐性のある表現を学習した。
実験結果
リサーチクエスチョン
- RQ1予測信頼度以外の指標が、ノイズありラベル補正において、正しい疑似ラベルを信頼性を持って特定できるか?
- RQ2疑似損失を用いて誤った疑似ラベルをフィルタリングすることで、確認バイアスが軽減され、ノイズありデータセットにおけるモデル精度が向上するか?
- RQ3一部の疑似ラベルが誤っている状況下で、提案された補間されたコントラスト目的関数が表現学習をどのように改善するか?
- RQ4PLSは、実世界のWebクロールデータセットにおける分布内および分布外のノイズに対しても汎用性を示せるか?
- RQ5アンサンブル手法やラベルスムージングに依存せずに、PLSは最先端の性能を達成できるか?
主な発見
- PLSは、ラベルスムージングやアンサンブル技術を用いずに、合成された分布内ノイズを有するCIFAR-100で最先端の精度を達成した。
- 混合された分布内および分布外ノイズを有するCIFAR-100では、PLSがOoD画像に対して低い疑似損失値を割り当てることで、誤った補正を効果的にフィルタリングした。
- 制御されたWeb破損実験(CNWL)では、単一のネットワークと自己教師付き事前学習なしでも、SNCFなどのSOTA手法を上回る性能を達成した。
- 実世界のWebクロールデータセット(Web-aircraft, Web-bird, Web-car)では、アンサンブル法やコラーニング法と同等またはそれ以上の性能を示し、強い汎用性を示した。
- 複数のベンチマークおよびノイズタイプで、従来の信頼度ベースの閾値を上回る、疑似損失指標の優位性が実証された。
- アブレーションスタディにより、補間されたコントラスト目的関数と疑似損失によるフィルタリングが、PLSの性能向上において両方とも不可欠な要素であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。