Skip to main content
QUICK REVIEW

[논문 리뷰] Early-Learning Regularization Prevents Memorization of Noisy Labels

Sheng Liu, Jonathan Niles‐Weed|arXiv (Cornell University)|2020. 06. 30.
Machine Learning and Data Classification참고 문헌 53인용 수 261
한 줄 요약

본 논문은 Early-Learning Regularization(ELR)을 도입해 초기 학습 역학과 반-지도 타깃 기반 정규화를 활용하여 노이즈 라벨의 기억화를 방지하고, 노이즈 라벨이 있는 벤치마크에서 경쟁적이거나 최첨단 성과를 달성합니다.

ABSTRACT

We propose a novel framework to perform classification via deep learning in the presence of noisy annotations. When trained on noisy labels, deep neural networks have been observed to first fit the training data with clean labels during an "early learning" phase, before eventually memorizing the examples with false labels. We prove that early learning and memorization are fundamental phenomena in high-dimensional classification tasks, even in simple linear models, and give a theoretical explanation in this setting. Motivated by these findings, we develop a new technique for noisy classification tasks, which exploits the progress of the early learning phase. In contrast with existing approaches, which use the model output during early learning to detect the examples with clean labels, and either ignore or attempt to correct the false labels, we take a different route and instead capitalize on early learning via regularization. There are two key elements to our approach. First, we leverage semi-supervised learning techniques to produce target probabilities based on the model outputs. Second, we design a regularization term that steers the model towards these targets, implicitly preventing memorization of the false labels. The resulting framework is shown to provide robustness to noisy annotations on several standard benchmarks and real-world datasets, where it achieves results comparable to the state of the art.

연구 동기 및 목표

  • 노이즈 라벨로 학습하는 연구를 동기 부여하고, 초기 학습과 기억화(memorization)를 고차원 현상의 기본으로 식별한다.
  • 초기 학습을 활용해 잘못된 라벨의 기억화를 줄이기 위한 정규화 기반 방법을 개발한다.
  • 반-지도 타깃 추정과 정규화를 활용해 잘못 기억된 라벨로 향하는 기울기를 벗어나도록 유도한다.
  • 표준 노이즈 라벨 벤치마크와 실제 데이터셋에서 ELR 및 ELR+를 실증적으로 평가하여 최첨단 방법과 비교한다.

제안 방법

  • 저자들은 노이즈 라벨 하에서 크로스 엔트로피의 기울기 역학을 분석하고, 잘못된 라벨의 기울기가 학습 후기에 지배적이 되는 패턴을 확인한다.
  • 그들은 cross-entropy에 L_ELR를 더하는 정규화 항을 제안하는데, 이는 lambda/n sum_i log(1 - <p_i, t_i>)를 추가하는 형태로, 여기서 p_i는 모델 출력이고 t_i는 타깃 확률 추정치이다.
  • 타깃 t_i는 과거 모델 출력의 시간적 엔섬블링을 통해 계산되며, 가중치 평균 및 두 네트워크 구성(ELR+)으로 향상될 수 있다.
  • 그들은 ELR이 기울기에 보정항 g^i를 추가하는 기울기 형태를 제시하여, 깨끗한 라벨의 영향력을 높이고 잘못된 라벨의 영향을 약화시킨다고 설명한다.
  • 타깃 확률 t_i는 모멘텀 beta로 업데이트되며, 시간적 엔섬블링 또는 평균 가중 평균에서 파생될 수 있다.
  • 또한 데이터 증강(mixup) 및 네트워크 앙상블을 ELR+의 구성요소로 논의하여 견고성을 향상시킨다.

실험 결과

연구 질문

  • RQ1초기 학습 역학을 노이즈 라벨이 있는 고차원 분류에서 근본 현상으로 형식화할 수 있는가?
  • RQ2초기 학습 역학과 일정하게 맞춰진 정규화 접근법이 샘플 선택에 의존하지 않고 노이즈 라벨의 기억화를 방지할 수 있는가?
  • RQ3모델 출력으로부터 얻은 타깃 확률을 기울기에 통합해 학습을 깨끗한 라벨 예시로 편향시킬 수 있는 방법은 무엇인가?
  • RQ4ELR과 확장 변형 ELR+가 CIFAR-10/100, Clothing1M, WebVision에서 최첨단 노이즈 라벨 방법과 비교해 경쟁력 있는 성능을 보이는가?

주요 결과

  • ELR은 CIFAR-10/100에서 대체로 대칭/비대칭 라벨 노이즈에 대한 강건성을 여러 기초 모델 대비 지속적으로 향상시킨다.
  • ELR+는 시간적 엔섬블링, 가중치 평균, 두 네트워크, mixup 데이터 증가를 결합해 성능을 더 향상시키고 Clothing1M에서 최첨단 성능을, WebVision에서 경쟁력 있는 결과를 달성한다.
  • 이론적 분석은 초기 학습이 깨끗한 라벨의 기울기를 초기에는 지배하지만 나중에는 잘못된 라벨의 기울기가 지배할 수 있음을 보이고, ELR의 기울기 보정이 기억화를 상쇄한다.
  • 소거 연구는 각 구성요소(시간적 엔섬블링, 가중치 평균, 두 네트워크, mixup)가 독립적으로 이득에 기여하며, 특히 노이즈 수준이 높을수록 그 효과가 두드러진다고 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.