Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Instance-Level Label Noise: Disparate Impacts and Treatments

Yang Liu|arXiv (Cornell University)|2021. 02. 10.
Machine Learning and Data Classification인용 수 9
한 줄 요약

이 논문은 과다 매개변수화된 모델에서 인스턴스 수준의 레이블 노이즈에 대한 이론적 분석을 제공하며, 노이즈 레이블이 저주파수 인스턴스에 더 심각하게 악영향을 미친다는 점과 기존의 강건한 학습 방법들이 고주파수와 저주파수 인스턴스를 이질적으로 대응함으로써 장기 꼬리 케이스에서 노이즈를 수정하지 못하는 경향이 있다는 점을 드러낸다. 피어 손실(Peer Loss)과 손실 보정 기법이 일반화를 향상시키는 조건을 규명하여 노이즈 레이블 학습에서의 경험적 관찰에 대한 이론적 근거를 제공한다.

ABSTRACT

This paper aims to provide understandings for the effect of an over-parameterized model, e.g. a deep neural network, memorizing instance-dependent noisy labels. We first quantify the harms caused by memorizing noisy instances, and show the disparate impacts of noisy labels for sample instances with different representation frequencies. We then analyze how several popular solutions for learning with noisy labels mitigate this harm at the instance level. Our analysis reveals that existing approaches lead to disparate treatments when handling noisy instances. While higher-frequency instances often enjoy a high probability of an improvement by applying these solutions, lower-frequency instances do not. Our analysis reveals new understandings for when these approaches work, and provides theoretical justifications for previously reported empirical observations. This observation requires us to rethink the distribution of label noise across instances and calls for different treatments for instances in different regimes.

연구 동기 및 목표

  • 대부분의 레이블 노이즈가 다양한 표현 빈도를 가진 인스턴스들에 일반화에 미치는 영향의 차이를 이해하기 위해.
  • 기존의 강건한 학습 방법들이 고주파수 및 저주파수 예제에 대해 노이즈 레이블을 다룰 때 인스턴스 수준에서 어떻게 작동하는지 분석하기 위해.
  • 인기 있는 방법들이 노이즈 레이블을 기억하는 것보다 일반화를 향상시키는 데 성공하는 이론적 조건을 제공하기 위해.
  • 피어 손실이 노이즈 비율 지식 없이도 확신 있는 예측을 유도하고 손실 보정을 능가하는 등의 경험적 관찰을 설명하기 위해.

제안 방법

  • Feldman(2020)의 분석 프레임워크를 확장하여 인스턴스 수준에서 노이즈 레이블을 기억할 경우의 영향을 정량화한다.
  • 전이 행렬과 레이블 사전 확률을 사용하여 피어 손실(PL)과 손실 보정의 훈련 손실에 대한 확률론적 분석을 도입한다.
  • 피어 손실 하에서 진짜 레이블을 예측할 경우 훈련 손실이 낮아질 확률에 대한 경계를 유도하며, 이는 인스턴스 빈도 $ l $ 에 조건부로 한다.
  • Kullback-Leibler 발산과 농도 부등식을 사용하여 저주파수 인스턴스에서 피어 손실의 실패 확률을 경계한다.
  • 피어 손실과 손실 보정을 비교하기 위해, 이들이 노이즈 레이블을 교정하는 데 암묵적으로 후행 분포를 어떻게 활용하는지 분석한다.
  • Chernoff 경계와 尾 확률 추정을 포함한 이론적 도구를 활용하여, 다양한 인스턴스 빈도에서 노이즈 교정의 신뢰성을 평가한다.

실험 결과

연구 질문

  • RQ1훈련 데이터에서 인스턴스의 빈도가 노이즈 레이블이 모델 일반화에 미치는 영향에 어떻게 영향을 미치는가?
  • RQ2기존의 강건한 학습 방법들이 인스턴스 수준에서 노이즈 레이블을 성공적으로 교정할 수 있는 조건은 무엇인가?
  • RQ3피어 손실은 왜 노이즈 전이 행렬 지식 없이도 잘 작동하는가? 그리고 언제 실패하는가?
  • RQ4피어 손실이 저주파수 인스턴스에 대해 잘못된 레이블을 예측할 확률은 얼마인가?
  • RQ5일반화 오차에 대한 이론적 경계가 노이즈 레이블 학습에서의 경험적 관찰을 어떻게 설명하는가?

주요 결과

  • 고주파수 인스턴스는 노이즈 레이블로 인한 일반화 손실이 더 크지만, 레이블 정보가 풍부하므로 기존 방법들에 의해 더 잘 교정된다.
  • 저주파수 인스턴스는 전체 일반화 오차에 기여도가 낮지만, 노이즈 교정 실패에 더 취약하며, 피어 손실이 잘못된 레이블을 예측할 확률이 최소 $ \frac{1}{\sqrt{2l}}e^{-l\cdot D_{\text{KL}}\left(\frac{1}{2}\|e_{\text{sgn}(y)}\right)} $ 이상이다.
  • 피어 손실은 고주파수 인스턴스에 대해 일반화 오차를 향상시킬 확률가 최소 $ 1 - e^{-\frac{2l}{p^{2}_{\text{sgn}(-y)}(1 - e_{+} - e_{-})^{2}}} $ 이상이며, 충분한 데이터가 확보될 경우 손실 보정을 능가한다.
  • 이론적 분석은 피어 손실이 확신 있는 예측을 유도함을 확인한다(보조정리 3), 이는 노이즈 비율 지식 없이도 경험적 성공을 설명한다.
  • 손실 보정과 피어 손실은 모두 암묵적으로 후행 분포를 사용하여 노이즈를 교정하지만, 피어 손실은 더 극단적인 예측을 유도함으로써 데이터가 충분할 경우 더 나은 성능을 낸다.
  • 이 논문은 기존 방법들이 이질적인 대응을 초래한다는 점을 드러내며, 고주파수 인스턴스는 신뢰성 있게 교정되지만, 저주파수 인스턴스는 특히 피어 손실 하에서 잘못된 교정의 위험이 상당히 높다는 점을 밝힌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.