Skip to main content
QUICK REVIEW

[논문 리뷰] To Smooth or Not? When Label Smoothing Meets Noisy Labels

Jiaheng Wei, Hangyu Liu|arXiv (Cornell University)|2021. 06. 08.
Machine Learning and Data Classification인용 수 16
한 줄 요약

이 논문은 노이즈가 있는 레이블 상황에서 레이블 스무딩(LS)과 음성 레이블 스무딩(NLS)을 조사하며, 낮은 노이즈에서는 LS가 일반화를 향상시키지만, 높은 노이즈에서는 모델의 신뢰도 향상으로 인해 NLS가 더 효과적임을 보여준다. 주요 기여는 최적 스무딩 비율에 대한 단계 전이 현상을 이론적·실험적으로 입증한 것으로, 노이즈 비율이 임계값을 초과하면 NLS가 LS를 능가함을 밝혀낸다.

ABSTRACT

Label smoothing (LS) is an arising learning paradigm that uses the positively weighted average of both the hard training labels and uniformly distributed soft labels. It was shown that LS serves as a regularizer for training data with hard labels and therefore improves the generalization of the model. Later it was reported LS even helps with improving robustness when learning with noisy labels. However, we observed that the advantage of LS vanishes when we operate in a high label noise regime. Intuitively speaking, this is due to the increased entropy of $\mathbb{P}( ext{noisy label}|X)$ when the noise rate is high, in which case, further applying LS tends to "over-smooth" the estimated posterior. We proceeded to discover that several learning-with-noisy-labels solutions in the literature instead relate more closely to negative/not label smoothing (NLS), which acts counter to LS and defines as using a negative weight to combine the hard and soft labels! We provide understandings for the properties of LS and NLS when learning with noisy labels. Among other established properties, we theoretically show NLS is considered more beneficial when the label noise rates are high. We provide extensive experimental results on multiple benchmarks to support our findings too. Code is publicly available at https://github.com/UCSC-REAL/negative-label-smoothing.

연구 동기 및 목표

  • 노이즈가 있는 레이블로 훈련할 때 레이블 스무딩(LS)과 음성 레이블 스무딩(NLS) 간의 상호 상충 관계를 이해하기 위해.
  • 레이블 스무딩이 고노이즈 환경에서 효과를 失하는 이유를 조사하기 위해, 이는 후행 분포의 과도한 스무딩으로 이어질 수 있음.
  • 고노이즈 환경에서 NLS가 모델 신뢰도와 일반화를 향상시킨다는 것을 이론적·실험적으로 입증하기 위해.
  • 특정 노이즈 모델 하에서 기존의 강건한 학습 방법인 Loss Correction, NLNL, Peer Loss와 NLS를 연결하기 위해.
  • 추정된 노이즈 수준에 기반해 최적 스무딩 비율을 선택하는 원칙적인 프레임워크를 제공하기 위해.

제안 방법

  • 음수 스무딩 비율을 允허하는 일반화된 레이블 스무딩(GSL) 공식을 제안하며, 이는 $\mathbf{y}^{\text{GLS},r} = (1-r)\cdot\mathbf{y} + \frac{r}{K}\cdot\mathbf{1}$ 으로 정의되며, 여기서 $r \in (-\infty, 1]$ 이다.
  • 노이즈가 있는 레이블 하에서의 기대 위험을 이론적으로 분석하고, GLS에서 음수 $r$ 이 진짜 위험을 최소화하는 조건을 유도한다.
  • 레이블 노이즈 비율 $e$ 에 따라 최적 스무딩 비율 $r_{\text{opt}}$ 에서 발생하는 단계 전이를 식별하며, 낮은 노이즈에서는 $r_{\text{opt}} > 0$, 높은 노이즈에서는 $r_{\text{opt}} < 0$ 임을 보여준다.
  • NLS가 올바른 예측에 대한 모델 신뢰도를 높이고 잘못된 예측에 대해서는 낮추어, 노이즈 하에서의 강건성과 일반화를 향상시킴을 보여준다.
  • NLS를 기존의 강건한 학습 방법인 Loss Correction, NLNL, Peer Loss와 연결하며, 특정 노이즈 모델 하에서 이들이 NLS의 특정 공식화와 동치임을 보여준다.
  • 다양한 벤치마크에서 실험적으로 결과를 검증하여, 노이즈가 증가함에 따라 최적 스무딩 비율이 양수에서 음수로의 전이가 명확히 나타나는 것을 확인한다.

실험 결과

연구 질문

  • RQ1노이즈가 있는 레이블로 훈련할 때, 레이블 스무딩이 성능 향상에 실패하는 조건는 무엇인가?
  • RQ2왜 고노이즈 환경에서 음성 레이블 스무딩(NLS)이 표준 레이블 스무딩(LS)을 능가하는가?
  • RQ3레이블 노이즈 비율에 따라 최적 스무딩 비율에 이론적 단계 전이가 존재하는가?
  • RQ4NLS와 LS는 모델 신뢰도와 일반화 오차에 어떤 차이를 미치는가?
  • RQ5Loss Correction 및 Peer Loss와 같은 기존의 강건한 학습 방법들이 음성 레이블 스무딩의 사례로 해석될 수 있는가?

주요 결과

  • 레이블 노이즈 비율이 낮을 경우, 양수 $r$ 을 가진 레이블 스무딩(LS)이 NLS보다 더 좋은 성능을 낸다. 이는 정규화 역할을 하기 때문이다.
  • 고노이즈 환경에서는 음수 $r < 0$ 인 음성 레이블 스무딩(NLS)이 더 효과적이며, 이는 후행 분포의 과도한 스무딩을 방지하기 때문이다.
  • 최적 스무딩 비율 $r_{\text{opt}}$ 는 레이블 노이즈 비율이 증가함에 따라 양수에서 음수로의 단계 전이를 겪으며, 임계 노이즈 수준에서 $r_{\text{opt}} = 0$ 이다.
  • NLS는 올바른 예측에 대한 모델 신뢰도를 높이고 잘못된 예측에 대해서는 낮추어, 노이즈 하에서의 강건성과 일반화를 향상시킨다.
  • Loss Correction, NLNL, Peer Loss 는 특정한 노이즈 비율 모델 하에서 NLS 와 동치임을 입증하여 이론적 프레임워크를 검증한다.
  • CIFAR-10 및 UCI 데이터셋에서의 실험 결과는 노이즈 비율이 증가함에 따라 최적 스무딩 비율이 양수에서 음수로 전이되며, 고노이즈에서는 NLS 가 더 높은 테스트 정확도를 달성함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.