Skip to main content
QUICK REVIEW

[논문 리뷰] CurriculumNet: Weakly Supervised Learning from Large-Scale Web Images

Sheng Guo, Weilin Huang|arXiv (Cornell University)|2018. 08. 03.
Machine Learning and Data Classification참고 문헌 27인용 수 21
한 줄 요약

CurriculumNet는 특성 공간 분포 밀도를 통한 데이터 복잡도 순서 매기기를 통해 노이즈가 많은 레이블을 가진 대규모 웹 이미지에서 깊은 CNN을 훈련시키는 커리큘럼 학습 전략을 제안한다. 이는 웹비전에서 상위 5개 오류를 5.2%로 줄이며 이전 방법보다 상대 오차 감소율이 50% 이상을 기록하여 최신 기술 수준을 달성한다.

ABSTRACT

We present a simple yet efficient approach capable of training deep neural networks on large-scale weakly-supervised web images, which are crawled raw from the Internet by using text queries, without any human annotation. We develop a principled learning strategy by leveraging curriculum learning, with the goal of handling a massive amount of noisy labels and data imbalance effectively. We design a new learning curriculum by measuring the complexity of data using its distribution density in a feature space, and rank the complexity in an unsupervised manner. This allows for an efficient implementation of curriculum learning on large-scale web images, resulting in a high-performance CNN model, where the negative impact of noisy labels is reduced substantially. Importantly, we show by experiments that those images with highly noisy labels can surprisingly improve the generalization capability of the model, by serving as a manner of regularization. Our approaches obtain state-of-the-art performance on four benchmarks: WebVision, ImageNet, Clothing-1M and Food-101. With an ensemble of multiple models, we achieved a top-5 error rate of 5.2% on the WebVision challenge for 1000-category classification. This result was the top performance by a wide margin, outperforming second place by a nearly 50% relative error rate. Code and models are available at: https://github.com/MalongTech/CurriculumNet .

연구 동기 및 목표

  • 대규모 웹 이미지 데이터셋에서 노이즈가 많은 레이블을 가진 깊은 CNN을 훈련시키는 데 도전하는 것.
  • 인간의 애너테이션 없이 커리큘럼 학습을 활용하여 모델의 일반화 능력과 성능을 향상시키는 것.
  • 매우 노이즈가 많은 레이블이 모델 능력을 떨어뜨리기보다는 향상시킬 수 있는지 조사하는 것.
  • 대규모 노이즈가 많은 웹 데이터에 특화된 효율적이고 비지도 학습 기반의 커리큘럼 전략을 개발하는 것.
  • 웹비전, ImageNet, Clothing-1M, Food-101 등 다양한 벤치마크에서 최신 기술 성능을 달성하는 것.

제안 방법

  • 이 방법은 특성 공간 내 분포 밀도를 측정하여 복잡도 순으로 훈련 샘플을 순서 매기는 새로운 커리큘럼 학습 전략을 도입한다.
  • 클러스터링 기반의 밀도 추정을 사용하여 비지도 방식으로 복잡도를 계산하여 쉬운 것에서 어려운 것으로 샘플을 식별한다.
  • 훈련은 복잡도가 낮은(밀도가 높은) 샘플부터 시작하여 점차 더 복잡한 샘플로 진행된다.
  • 이 접근법은 노이즈 제거나 모델 재학습이 필요 없으며, 노이즈가 있는 데이터를 학습 과정의 일부로 직접 활용한다.
  • 표준 CNN 아키텍처(예: Inception-v2)를 사용하여 커리큘럼 기반의 데이터 순서에 따라 모델을 처음부터 훈련시킨다.
  • 앙상블 학습을 적용하여 특히 웹비전 도전 대회에서 성능을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1커리큘럼 학습 전략이 대규모 웹 이미지 데이터셋의 막대한 노이즈 레이블을 효과적으로 처리할 수 있는가?
  • RQ2훈련 중에 매우 노이즈가 많은 이미지를 포함시키면 성능 저하 대신 일반화 능력 향상에 기여하는가?
  • RQ3특성 공간 밀도를 통한 비지도 복잡도 순서 매김이 히우리스틱 또는 수동 커리큘럼 설계를 능가하는가?
  • RQ4커리큘럼 학습 전략은 약한 감독 훈련 벤치마크에서 최신 기술 방법과 비교해 어떻게 성능을 내는가?
  • RQ5이 커리큘럼 전략은 노이즈 수준이 다양한 다양한 데이터셋에 일반화 가능한가?

주요 결과

  • 웹비전 2017 도전 대회에서 CurriculumNet은 상위 5개 오류율을 5.2%로 기록하여 두 번째로 높은 성능을 낸 방법보다 약 50%의 상대 오차 감소율을 기록했다.
  • 웹비전 데이터셋에서 CurriculumNet은 기준 모델의 상위 5개 오류율 14.2%를 10.8%로 줄였으며, CleanNet(12.2%)과 MentorNet(12.0%)를 모두 뛰어넘었다.
  • Clothing-1M에서 CurriculumNet은 상위 1 정확도를 18.5%로 향상시켜 CleanNet(20.1%)과 Patrini 등(19.6%)을 1.6~3.3%p 뛰어넘었다.
  • Food-101에서 CurriculumNet은 레이블이 무작위로 20%로 설정된 데이터로도 상위 1 오류율 12.7%를 기록하여 FoodNet(27.9%)과 CleanNet(16.0%)을 모두 앞섰다.
  • 웹비전과 ImageNet 데이터를 결합했을 때 CurriculumNet은 ImageNet의 상위 5개 오류율을 8.6%에서 7.1%로 줄였으며, 높은 노이즈 내성과 데이터 효율성의 가능성을 입증했다.
  • 모델은 매우 노이즈가 많은 레이블이 커리큘럼 훈련 스케줄에 포함될 경우 정규화 역할을 하여 일반화 능력을 향상시킬 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.