Skip to main content
QUICK REVIEW

[論文レビュー] Mitigating Memorization of Noisy Labels via Regularization between Representations

Hao Cheng, Zhaowei Zhu|arXiv (Cornell University)|Oct 18, 2021
Machine Learning and Data Classification被引用数 8
ひとこと要約

本稿では、自己教師あり特徴距離と教師ありモデル出力距離の正の相関を強制することで、深層ニューラルネットワークにおけるノイズのラベルの記憶を緩和する表現正則化項を提案する。ネットワークをエンコーダと線形分類器に分離することで、アーキテクチャの変更なしに関数空間を制限し、特に高ノイズ率下でも顕著にロバストネスを向上させ、既存のロバスト損失関数とも互換性を持つ。

ABSTRACT

Designing robust loss functions is popular in learning with noisy labels while existing designs did not explicitly consider the overfitting property of deep neural networks (DNNs). As a result, applying these losses may still suffer from overfitting/memorizing noisy labels as training proceeds. In this paper, we first theoretically analyze the memorization effect and show that a lower-capacity model may perform better on noisy datasets. However, it is non-trivial to design a neural network with the best capacity given an arbitrary task. To circumvent this dilemma, instead of changing the model architecture, we decouple DNNs into an encoder followed by a linear classifier and propose to restrict the function space of a DNN by a representation regularizer. Particularly, we require the distance between two self-supervised features to be positively related to the distance between the corresponding two supervised model outputs. Our proposed framework is easily extendable and can incorporate many other robust loss functions to further improve performance. Extensive experiments and theoretical analyses support our claims. Code is available at github.com/UCSC-REAL/SelfSup_NoisyLabel.

研究の動機と目的

  • 訓練中に高ノイズ率下でも深刻な問題となるノイズラベルの記憶を解消すること。
  • 一般化誤差を推定誤差と近似誤差に分解することで、ラベルノイズ下でのモデル容量選択を理論的に分析すること。
  • アーキテクチャの変更なしにDNNの関数空間を制限する、モデルに依存しない正則化フレームワークを提案すること。
  • 既存のロバスト損失関数と組み合わせた場合に、表現正則化が性能向上に寄与することを示すこと。
  • 低容量モデルがノイズデータセットでより良い一般化を示す可能性があることから、構造的正則化アプローチの動機づけを示すこと。

提案手法

  • DNNを固定エンコーダと学習可能な線形分類器に分解し、表現学習と分類を分離する。
  • 自己教師あり特徴のL2距離と教師ありモデル出力のL2距離の間の正の相関を強制する表現正則化項を導入する。
  • 予測距離とターゲット距離の乖離を測定するためにスムーズL1損失を用い、訓練の安定性を向上させる。
  • 事前学習段階で、対照的自己教師あり学習(例:SimCLR や MoCo)を用いてエンコーダを事前学習し、その後ノイズラベルで微調整する。
  • 標準的な交差エントロピー損失と正則化項を統合することで、既存のロバスト損失関数との互換性を確保する。
  • 早期停止とダウンサンプリング戦略を適用し、高ノイズ環境下での一般化ギャップをさらに縮小する。

実験結果

リサーチクエスチョン

  • RQ1一般化誤差を推定誤差と近似誤差に分解することで、ラベルノイズ下でのモデル容量選択にどのような示唆が得られるか?
  • RQ2自己教師ありと教師ありの特徴間に構造的整合性を強制する表現正則化項は、ノイズラベルの記憶を低減できるか?
  • RQ3特徴距離と出力距離の間の正の相関を強制することで、標準的なロバスト損失関数と比較して、ノイズデータセットにおけるロバストネスが向上するか?
  • RQ4この正則化項は、既存のロバスト損失関数とどの程度組み合わせて性能向上を達成できるか?
  • RQ5正則化項の有効性は、自己教師あり事前学習手法の選択に依存するか?

主な発見

  • 提案された正則化項は、特に高ノイズ率(例:0.8)下でノイズラベルの記憶を顕著に低減し、CIFAR10NおよびCIFAR100Nにおけるテスト精度を向上させる。
  • CIFAR10で対称ラベルノイズ率0.8の状況下、MoCoを用いた事前学習により88.51%の精度を達成し、固定エンコーダを用いた標準的な交差エントロピー損失を上回る。
  • アブレーションスタディにより、性能向上は主に正則化項の効果によるものであり、自己教師あり事前学習そのものによるものではないことが確認された。
  • 本手法はさまざまなSSL事前学習手法(SimCLR と MoCo)に対して一貫した性能を示し、汎用性が高いことが示された。
  • 正則化損失に標準MSEの代わりにスムーズL1損失を用いることで、訓練の安定性と一般化性能が向上した。
  • クラス分布のバランスを取るためにダウンサンプリングを適用することで、真のノイズ率が分かっていなくても一般化ギャップが縮小され、理論的主張を支持する結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。