Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Why Contrastive Learning Benefits Robustness Against Label Noise

Yihao Xue, Kyle Whitecross|arXiv (Cornell University)|Jan 29, 2022
Machine Learning and Data Classification被引用数 10
ひとこと要約

この論文は、対照的学習がラベルノイズに対して頑健性を向上させる理由を理論的に説明している。対照的学習は、部分クラスごとに顕著な特徴値を持ち、特徴ベクトルがクリーンラベルと強く整合する低ランク構造の表現を生成することを示している。これにより、線形分類器はノイズを記憶せずにクリーンラベルを学習可能となり、事前学習済みネットワークは過学習を遅らせる低ランクヤコビアンを示す。その結果、CIFAR-10とCIFAR-100で80%の対称的ラベルノイズ下でも、それぞれ27.18%および15.58%の精度向上を達成し、最先端の性能を発揮する。

ABSTRACT

Self-supervised Contrastive Learning (CL) has been recently shown to be very effective in preventing deep networks from overfitting noisy labels. Despite its empirical success, the theoretical understanding of the effect of contrastive learning on boosting robustness is very limited. In this work, we rigorously prove that the representation matrix learned by contrastive learning boosts robustness, by having: (i) one prominent singular value corresponding to each sub-class in the data, and significantly smaller remaining singular values; and (ii) {a large alignment between the prominent singular vectors and the clean labels of each sub-class. The above properties enable a linear layer trained on such representations to effectively learn the clean labels without overfitting the noise.} We further show that the low-rank structure of the Jacobian of deep networks pre-trained with contrastive learning allows them to achieve a superior performance initially, when fine-tuned on noisy labels. Finally, we demonstrate that the initial robustness provided by contrastive learning enables robust training methods to achieve state-of-the-art performance under extreme noise levels, e.g., an average of 27.18\% and 15.58\% increase in accuracy on CIFAR-10 and CIFAR-100 with 80\% symmetric noisy labels, and 4.11\% increase in accuracy on WebVision.

研究の動機と目的

  • 対照的学習が深層ネットワークにおけるラベルノイズに対して頑健性を向上させる理由を理論的に理解すること。
  • 対照的学習によって得られる表現の構造的性質を同定し、頑健性に寄与する要因を特定すること。
  • 対照的に事前学習されたネットワークにおけるヤコビアンの低ランク構造が、ノイズラベルでのファインチューニング中に過学習をどのように遅らせるかを分析すること。
  • 対照的事前学習が、極端なノイズレベル下で最先端の性能を達成する頑健なトレーニング手法を実現できることを実証すること。
  • 表現の整合性、特徴値構造、ラベルノイズ下での一般化の理論的リンクを確立すること。

提案手法

  • 対照的学習から得られる表現行列の理論的分析により、各部分クラスに対して1つの主要特徴値を持ち、残りの特徴値が顕著に小さいことを証明する。
  • 主要特徴ベクトルが各部分クラスの真のラベルと密接に一致することを証明し、クリーンラベルの学習を可能にする。
  • ノイズラベル下でこれらの表現に線形モデルを訓練した分析により、ラベルの不正な変更が影響をほとんど及ぼさず、誤ったラベルの記憶も最小限に抑えられることを示す。
  • 対照的に事前学習されたネットワークのヤコビアンが、ランダム初期化されたネットワークよりも主要特徴値と小さな特徴値の間隔が大きいことを理論的に導出する。
  • CIFAR-10、CIFAR-100、WebVisionにおける対称的および非対称的ラベルノイズを用いた実験的検証により、極端なノイズ下での精度向上を測定する。
  • エンコーダーを凍結するか否かでファインチューニングを比較し、過学習のダイナミクスと頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1対照的学習は、理論的理解が限られているにもかかわらず、なぜラベルノイズに対して頑健性を向上させるのか?
  • RQ2対照的学習から得られる表現行列のどのような構造的性質が頑健な一般化を可能にするのか?
  • RQ3特徴ベクトルとクリーンラベルとの整合性が、ノイズラベル下での学習にどのように影響を与えるのか?
  • RQ4なぜ対照的事前学習は、ノイズラベルでのファインチューニング中に過学習を遅らせるのか?
  • RQ5対照的学習による初期の頑健性は、下流の頑健なトレーニング手法によって、極端なノイズ下で最先端の性能を達成するために活用可能か?

主な発見

  • 対照的学習は、部分クラスごとに1つの顕著な特徴値を持ち、残りの特徴値が顕著に小さい表現行列を生成する。これにより、頑健な学習が可能になる。
  • 表現行列の顕著な特徴ベクトルは、各部分クラスのクリーンラベルと高い整合性を示し、ノイズラベルの記憶を低減する。
  • 対照的表現に基づいて訓練された線形モデルは、ラベルノイズ下でも性能低下が最小限に抑えられ、ノイズの影響がクリーンラベルの学習にほとんど及ばない。
  • 対照的に事前学習されたネットワークのヤコビアンは、ランダム初期化されたネットワークよりも主要特徴値と小さな特徴値の間隔が大きいため、ファインチューニング中に過学習が遅れる。
  • CIFAR-10とCIFAR-100で80%の対称的ラベルノイズを想定した場合、ベースライン手法比でそれぞれ平均27.18%および15.58%の精度向上を達成した。
  • 実世界のノイズラベルを含むWebVisionデータセットでも、4.11%の精度向上を達成し、極端なノイズ下で最先端の性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。