Skip to main content
QUICK REVIEW

[논문 리뷰] Learning with Noisy Labels Revisited: A Study Using Real-World Human Annotations

Jiaheng Wei, Zhaowei Zhu|arXiv (Cornell University)|2021. 10. 22.
Machine Learning and Data Classification참고 문헌 45인용 수 62
한 줄 요약

실세계 인간 주석이 달린 노이즈 레이블로 CIFAR-10N 및 CIFAR-100N 벤치마크를 도입하고, 인스턴스 의존적 인간 노이즈가 합성 클래스 의존 노이즈와 다르며 강건성 평가에 영향을 미친다는 것을 보여준다.

ABSTRACT

Existing research on learning with noisy labels mainly focuses on synthetic label noise. Synthetic noise, though has clean structures which greatly enabled statistical analyses, often fails to model real-world noise patterns. The recent literature has observed several efforts to offer real-world noisy datasets, yet the existing efforts suffer from two caveats: (1) The lack of ground-truth verification makes it hard to theoretically study the property and treatment of real-world label noise; (2) These efforts are often of large scales, which may result in unfair comparisons of robust methods within reasonable and accessible computation power. To better understand real-world label noise, it is crucial to build controllable and moderate-sized real-world noisy datasets with both ground-truth and noisy labels. This work presents two new benchmark datasets CIFAR-10N, CIFAR-100N, equipping the training datasets of CIFAR-10, CIFAR-100 with human-annotated real-world noisy labels we collected from Amazon Mechanical Turk. We quantitatively and qualitatively show that real-world noisy labels follow an instance-dependent pattern rather than the classically assumed and adopted ones (e.g., class-dependent label noise). We then initiate an effort to benchmarking a subset of the existing solutions using CIFAR-10N and CIFAR-100N. We further proceed to study the memorization of correct and wrong predictions, which further illustrates the difference between human noise and class-dependent synthetic noise. We show indeed the real-world noise patterns impose new and outstanding challenges as compared to synthetic label noise. These observations require us to rethink the treatment of noisy labels, and we hope the availability of these two datasets would facilitate the development and evaluation of future learning with noisy label solutions. Datasets and leaderboards are available at http://noisylabels.com.

연구 동기 및 목표

  • 실세계 라벨 노이즈를 합성 모델을 넘어서 연구하도록 동기를 부여하고, 실제 정답 라벨과 노이즈 라벨이 함께 제공되는 접근 가능한 벤치마크를 제시한다.
  • CIFAR-10 및 CIFAR-100에서 인간이 주석한 노이즈의 분포와 패턴을 특성화한다.
  • 실제 인간 노이즈에 대해 광범위한 강건 학습 방법을 벤치마크하고 이를 합성 노이즈와 비교한다.
  • 실세계의 노이즈가 있는 감독 하에서 기억화(memorization) 행동을 조사하여 학습 역학을 이해한다.

제안 방법

  • CIFAR-10N과 CIFAR-100N을 만들기 위해 CIFAR-10에 대해서는 이미지별로 Amazon Mechanical Turk를 통해 세 개의 인간 주석을 수집하고 CIFAR-100에 대해서는 이미지당 하나를 수집하며, 평가를 위해 CIFAR의 실제 정답 라벨을 보유한다.
  • 데이터셋 간 인스턴스 의존적이고 불균형하며 특징과 연관된 라벨 반전이 존재한다는 것을 보여주기 위해 노이즈 패턴을 분석한다.
  • 노이즈 전이 행렬과 가설 검정을 사용하여 특징 의존성을 평가하고, 인간 주석 노이즈를 합성 클래스 의존 노이즈와 비교한다.
  • CIFAR-10N 및 CIFAR-100N에서 광범위한 강건 학습 방법들(손실 보정, 재가중치 부여, 정규화, 반지도 학습 스타일의 샘플링)을 평가한다.
  • 실세계 노이즈 하에서의 기억화 행동을 조사하여 합성 노이즈 시나리오와의 차이를 밝힌다.

실험 결과

연구 질문

  • RQ1실세계의 인간 주석이 클래스 의존적인 합성 노즈와 다르게 인스턴스 의존적 노이즈 패턴을 보이는가?
  • RQ2CIFAR-10N과 CIFAR-100N의 노이즈 분포는 비슷한 클래스 간의 불균형 및 라벨 반전 측면에서 어떻게 다른가?
  • RQ3인기 있는 강건 학습 방법들이 실제 세계의 노이즈 라벨과 합성 노이즈에 대해 어떻게 성능을 보이는가?
  • RQ4인간이 생성한 라벨 노이즈와 비교하여 합성 노이즈일 때 어떤 기억화 역학이 발생하는가?

주요 결과

  • 실세계 인간 노이즈는 인스턴스 의존적이며 합성 클래스 의존 노이즈로 잘 포착되지 않는 불균형하고 특징과 상관된 라벨 반전을 나타낸다.
  • 사람들은 시각적으로 비슷한 클래스 간에 잘못 라벨하는 경향이 있으며 CIFAR-100 이미지의 경우 여러 개의 깨끗한 라벨이 공존할 수 있어 새로운 노이즈 패턴이 형성된다.
  • 방법에 관계없이 실세계 노이즈는 합성 노이즈보다 학습 어려움을 더 많이 야기하며, 주목할 만한 성능 격차와 기억화 차이를 보인다.
  • 일부 방법(예: ELR+, Divide-Mix)은 합성 노이즈에서 견고한 성능을 보이지만 인간 노이즈에서는 다른 동작을 보이며, 특정 설정에서 인간 노이즈가 일부 접근법의 성능을 약간 더 좋게 만드는 경우도 있다.
  • 기억화 연구는 신경망이 인간 노이즈 하에서 잘못된 라벨을 더 쉽게 기억하는 경향이 있음을 보여주며, 이는 학습 역학이 다름을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.