Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Deep Networks from Noisy Labels with Dropout Regularization

Ishan Jindal, Matthew Nokleby|arXiv (Cornell University)|2017. 05. 09.
Machine Learning and Data Classification참고 문헌 12인용 수 19
한 줄 요약

이 논문은 노이즈 있는 레이블을 가진 데이터셋에서 깊이 신경망을 훈련시키기 위한 방법을 제안한다. 노이즈 모델링 소프트맥스 레이어를 네트워크에 추가하고, 노이즈 모델 가중치에 대해 강력한 드롭아웃 정규화를 적용함으로써, 분류기와 낙관적인, 과대평가된 노이즈 모델을 동시에 학습한다. 이 방법은 CIFAR-10과 MNIST에서 최신 기술을 초월하는 성능을 달성하며, 노이즈 통계가 알려진 지네 모델을 능가함에도 불구하고 효과적이다.

ABSTRACT

Large datasets often have unreliable labels-such as those obtained from Amazon's Mechanical Turk or social media platforms-and classifiers trained on mislabeled datasets often exhibit poor performance. We present a simple, effective technique for accounting for label noise when training deep neural networks. We augment a standard deep network with a softmax layer that models the label noise statistics. Then, we train the deep network and noise model jointly via end-to-end stochastic gradient descent on the (perhaps mislabeled) dataset. The augmented model is overdetermined, so in order to encourage the learning of a non-trivial noise model, we apply dropout regularization to the weights of the noise model during training. Numerical experiments on noisy versions of the CIFAR-10 and MNIST datasets show that the proposed dropout technique outperforms state-of-the-art methods.

연구 동기 및 목표

  • 아마존 메카니컬 터크와 같은 출처에서 유래한 신뢰할 수 없고 잘못 레이블링된 데이터를 포함한 대규모 데이터셋에서 깊이 신경망을 훈련시키는 과제를 해결하기 위해.
  • 랜덤 또는 비균일한 레이블 뒤집힘에 의해 손상된 레이블이 있는 경우 모델의 일반화 성능을 향상시키기 위해.
  • 노이즈 통계에 대한 사전 지식이 필요 없이 깊이 신경망과 강력한 레이블 노이즈 모델을 동시에 학습할 수 있는 방법을 개발하기 위해.
  • 노이즈 모델이 과적합되지 않도록 하기 위해, 레이블 뒤집힘의 비현실적이지만 낙관적인 표현을 학습하도록 유도하기 위해.

제안 방법

  • 열-스토케스티컬 매트릭스 Ψ를 사용하여 쌍별 레이블 뒤집힘 확률을 모델링하는 소프트맥스 레이어를 표준 딥 네트워크에 추가한다.
  • 노이즈 있는 데이터셋에서 엔드 투 엔드 확률적 경사 하강법을 통해 딥 네트워크와 노이즈 모델을 동시에 훈련시킨다.
  • 노이즈 모델의 소프트맥스 레이어 가중치에 대해 특별히 강력한 드롭아웃 정규화를 적용하여 과적합을 방지하고 낙관적인 노이즈 모델 학습을 장려한다.
  • 학습된 노이즈 모델을 사용해 역전파 동안 훈련 레이블을 디노이징한다. 이는 레이블 오염을 효과적으로 보정한다.
  • 훈련 후 노이즈 모델을 분리하고 테스트 데이터에 대한 추론에는 오직 딥 네트워크만을 사용한다.
  • 이 방법은 계산적으로 효율적이며, 완전히 병렬화 가능하고 기존 딥 러닝 프레임워크와 호환된다.

실험 결과

연구 질문

  • RQ1드롭아웃 정규화를 적용한 공동 훈련된 노이즈 모델이 기존 방법보다 노이즈 있는 레이블에서 더 나은 성능을 내는가?
  • RQ2낙관적인, 과대평가된 노이즈 모델이 레이블 노이즈가 존재하는 상황에서 일반화 성능을 향상시키는가?
  • RQ3제안된 방법이 레이블 노이즈 통계를 정확히 알고 있는 모델(즉, 지네 모델)을 능가할 수 있는가?
  • RQ4특히 비균일한 노이즈 분포일 경우, 고수준의 노이즈 수준에서 이 방법은 어떤 성능을 보이는가?
  • RQ5왜 모델이 레이블 뒤집힘 확률을 과대평가하게 되는가? 이는 특징 클러스터링과 분류 정확도에 어떤 영향을 미치는가?

주요 결과

  • 70% 균일한 레이블 노이즈가 있는 MNIST 데이터셋에서, 제안된 드롭아웃 정규화 방법은 2.83%의 분류 오차를 기록했으며, 이는 [10]의 부트스트랩 방법이 같은 노이즈 수준에서 45%의 오차를 기록한 것보다 뛰어난 성능이다.
  • MNIST에서 70% 비균일한 노이즈가 존재할 경우, 이 방법은 기준 모델의 53.55% 오차와 50% 노이즈에서 45% 오차를 기록한 부트스트랩 방법보다 훨씬 낮은 43.03%의 오차를 기록했다.
  • 70% 균일한 노이즈가 있는 CIFAR-10에서, 이 방법은 24.6%의 오차를 기록했으며, 기준 모델(48.80%)과 진짜 노이즈 모델(48.80%)보다 뛰어난 성능을 보였다.
  • 학습된 노이즈 모델은 일관되게 레이블 뒤집힘 확률을 과대평가하며, 이는 모호한 데이터의 자연스러운 클러스터링을 장려하는 낙관적인 편향을 암시한다.
  • 어떤 경우에서는 노이즈 통계를 정확히 알고 있는 지네 모델을 능가하는 성능을 기록하기도 하며, 특히 고수준의 노이즈 수준에서 두드러진다.
  • 이 방법은 계산적으로 효율적이며, 완전히 병렬화 가능하고 표준 딥 러닝 라이브러리로 쉽게 구현할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.