Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating Why Contrastive Learning Benefits Robustness Against Label Noise

Yihao Xue, Kyle Whitecross|arXiv (Cornell University)|2022. 01. 29.
Machine Learning and Data Classification인용 수 10
한 줄 요약

이 논문은 대조 학습이 어떻게 레이블 노이즈에 대한 강건성을 향상시키는지 이론적으로 설명한다. 대조 학습은 하위 클래스별로 두드러진 특이값을 가지며, 특이 벡터가 정확한 레이블과 강하게 정렬되는 낮은 질서의 구조를 갖는 표현을 생성하기 때문이다. 이는 선형 분류기가 노이즈를 기억하지 않고도 정확한 레이블을 학습할 수 있도록 하며, 사전 훈련된 네트워크가 과적합을 지연시키는 낮은 질서의 자코비안을 가지게 하여 극단적인 노이즈 수준에서도 최신 기술 성능을 달성한다. 예를 들어, 대칭 노이즈가 80%인 CIFAR-10과 CIFAR-100에서 각각 27.18%와 15.58%의 정확도 향상을 기록한다.

ABSTRACT

Self-supervised Contrastive Learning (CL) has been recently shown to be very effective in preventing deep networks from overfitting noisy labels. Despite its empirical success, the theoretical understanding of the effect of contrastive learning on boosting robustness is very limited. In this work, we rigorously prove that the representation matrix learned by contrastive learning boosts robustness, by having: (i) one prominent singular value corresponding to each sub-class in the data, and significantly smaller remaining singular values; and (ii) {a large alignment between the prominent singular vectors and the clean labels of each sub-class. The above properties enable a linear layer trained on such representations to effectively learn the clean labels without overfitting the noise.} We further show that the low-rank structure of the Jacobian of deep networks pre-trained with contrastive learning allows them to achieve a superior performance initially, when fine-tuned on noisy labels. Finally, we demonstrate that the initial robustness provided by contrastive learning enables robust training methods to achieve state-of-the-art performance under extreme noise levels, e.g., an average of 27.18\% and 15.58\% increase in accuracy on CIFAR-10 and CIFAR-100 with 80\% symmetric noisy labels, and 4.11\% increase in accuracy on WebVision.

연구 동기 및 목표

  • 대조 학습이 딥 네트워크에서 레이블 노이즈에 대해 강건성을 향상시키는 이유를 이론적으로 이해하는 것.
  • 대조 학습을 통해 학습된 표현의 구조적 특성 중 강건성에 기여하는 요소를 규명하는 것.
  • 대조적으로 사전 훈련된 네트워크에서 자코비안의 저랭크 구조가 노이즈가 있는 레이블에 대한 피니튜닝 중 과적합을 어떻게 지연시키는지 분석하는 것.
  • 대조 학습 사전 훈련이 극단적인 노이즈 수준에서 최신 기술 성능을 달성할 수 있는 강건한 훈련 방법을 어떻게 활용할 수 있는지 보여주는 것.
  • 레이블 노이즈 하에서 일반화와 표현 정렬, 특이값 구조 사이의 이론적 연결 고리를 확립하는 것.

제안 방법

  • 대조 학습에서 유도된 표현 행렬에 대한 이론적 분석을 통해 각 하위 클래스별로 하나의 주요 특이값과 상당히 작은 나머지 특이값을 갖는다는 것을 증명한다.
  • 주요 특이 벡터가 각 하위 클래스의 진정한 레이블과 밀접하게 정렬되어 있음을 증명함으로써 정확한 레이블 학습이 가능하다.
  • 노이즈가 있는 레이블 하에서 이러한 표현에 기반한 선형 모델을 훈련한 분석을 통해 레이블 손상에 거의 영향을 받지 않으며 잘못된 레이블의 기억이 최소화됨을 보여준다.
  • 대조적으로 사전 훈련된 네트워크의 자코비안이 무작위 초기화된 네트워크보다 주요 특이값과 작은 특이값 사이의 갭이 더 크다는 것을 이론적으로 유도한다.
  • 대칭 및 비대칭 레이블 노이즈 하에서 CIFAR-10, CIFAR-100 및 WebVision에서의 실험을 통해 극단적인 노이즈 수준에서의 정확도 향상을 측정한다.
  • 고정된 vs. 고정되지 않은 인코더를 사용한 피니튜닝을 비교하여 과적합 동역학과 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1대조 학습이 레이블 노이즈에 대해 강건성을 향상시키지만, 이론적 이해가 제한된 상황에서 그 이유는 무엇인가?
  • RQ2대조 학습에서 유도된 표현 행렬의 어떤 구조적 특성이 강건한 일반화에 기여하는가?
  • RQ3특이 벡터와 정확한 레이블 간의 정렬이 노이즈가 많은 감독 하에서 학습에 어떤 영향을 미치는가?
  • RQ4왜 대조적으로 사전 훈련된 네트워크가 노이즈가 있는 레이블에 대해 피니튜닝 시 과적합이 지연되는가?
  • RQ5대조 학습에서 유도된 초기 강건성이 하류의 강건한 훈련 방법에 의해 극단적인 노이즈 수준에서 최신 기술 성능을 달성하는 데 활용될 수 있는가?

주요 결과

  • 대조 학습은 각 하위 클래스별로 두드러진 특이값과 상당히 작은 나머지 특이값을 갖는 표현 행렬을 생성하여 강건한 학습을 가능하게 한다.
  • 표현 행렬의 두드러진 특이 벡터는 각 하위 클래스의 정확한 레이블과 높은 정렬도를 보이며, 노이즈 레이블의 기억을 줄인다.
  • 대조 표현에 기반한 선형 모델은 레이블 노이즈 하에서도 성능 저하가 거의 없으며, 노이즈가 정확한 레이블 학습에 거의 영향을 주지 않는다.
  • 대조적으로 사전 훈련된 네트워크는 랜덤 초기화된 네트워크보다 주요 특이값과 작은 특이값 사이의 갭이 더 크며, 이는 피니튜닝 중 과적합을 느리게 한다.
  • 대칭 노이즈가 80%인 CIFAR-10과 CIFAR-100에서 각각 기준 방법 대비 평균 정확도 향상이 27.18%와 15.58%를 기록한다.
  • 실제 세계의 노이즈 레이블이 포함된 WebVision 데이터셋에서 4.11%의 정확도 향상을 기록하여 극단적인 노이즈 조건에서도 최신 기술 성능을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.