Skip to main content
QUICK REVIEW

[논문 리뷰] Curriculum Loss: Robust Learning and Generalization against Label Corruption

Yueming Lyu, Ivor W. Tsang|arXiv (Cornell University)|2019. 05. 24.
Machine Learning and Data Classification참고 문헌 29인용 수 83
한 줄 요약

Curriculum Loss (CL)을 0-1 손실의 빠듯한 상한으로 제시하여 학습 샘플을 적응적으로 선택하고 잘못된 라벨에 대한 강건성을 향상시킵니다. 더 높은 노이즈율을 위한 Noise Pruned Curriculum Loss (NPCL)로 확장하고 미니배치 학습을 지원합니다.

ABSTRACT

Deep neural networks (DNNs) have great expressive power, which can even memorize samples with wrong labels. It is vitally important to reiterate robustness and generalization in DNNs against label corruption. To this end, this paper studies the 0-1 loss, which has a monotonic relationship with an empirical adversary (reweighted) risk~\citep{hu2016does}. Although the 0-1 loss has some robust properties, it is difficult to optimize. To efficiently optimize the 0-1 loss while keeping its robust properties, we propose a very simple and efficient loss, i.e. curriculum loss (CL). Our CL is a tighter upper bound of the 0-1 loss compared with conventional summation based surrogate losses. Moreover, CL can adaptively select samples for model training. As a result, our loss can be deemed as a novel perspective of curriculum sample selection strategy, which bridges a connection between curriculum learning and robust learning. Experimental results on benchmark datasets validate the robustness of the proposed loss.

연구 동기 및 목표

  • 라벨 손상 및 노이즈 라벨 하에서 심층 신경망의 강건성과 일반화를 촉진한다.
  • 최적화에 효율적으로 남아 있는 0-1 손실의 더 촘촘한 상한을 도입한다.
  • 학습을 위한 적응형 커리큘럼 기반 샘플 선택 메커니즘을 개발한다.
  • 높은 노이즈율에 대응하기 위해 CL에 노이즈 프루닝을 확장한다.
  • 미니배치 업데이트를 갖는 심층 모델용 실용적이고 플러그인 가능한 손실 함수를 제공한다.

제안 방법

  • 기저 손실 l(u)를 사용하고 l(u) ≥ 1(u<0)인 0-1 손실의 더 촘촘한 상한으로 Curriculum Loss (CL)을 정의한다.
  • CL 경계 J(u) ≤ Q(u) ≤ ŴJ(u)를 보이고 이진 선택자 v에 대한 부분 최적화를 통해 적응적 샘플 선택을 가능하게 한다.
  • 미니배치 지원을 갖춘 CL의 최적 샘플 부분집합을 계산하는 O(n log n) 알고리즘(알고리즘 1)을 제공한다.
  • 노이즈 비율 ε에 대한 사전 정보와 학습 중에 가능성이 높은 노이즈 샘플을 제거하는 가지치기 메커니즘(Eq. 18)을 도입하여 Noise Pruned Curriculum Loss (NPCL)을 도입한다.
  • 효율적인 미니배치 학습을 위한 배치 기반 버전(шL)을 제시한다(Eq. 20–21).
  • 샘플 선택을 표준 딥 러닝 워크플로에 통합하는 학습 절차(알고리즘 2)를 설명한다.

실험 결과

연구 질문

  • RQ1최적화 효율성을 희생하지 않으면서 0-1 손실의 더 촘촘한 상한이 라벨 손상에 대한 강건성을 향상시킬 수 있는가?
  • RQ2적응형 커리큘럼형 샘플 선택이 기존의 강건한 손실들보다 노이즈 라벨 하에서 일반화를 향상시키는가?
  • RQ3다양한 노이즈율과 데이터세트에서 NPCL이 기본 강건 손실과 비교하여 어떤 성능을 보이는가?
  • RQ4제안된 손실이 일반적인 딥 러닝 프레임워크에서 미니배치 업데이트로 플러그인 형태로 구현될 수 있는가?
  • RQ5CL/NPCL에 삽입된 샘플 선택 알고리즘의 계산 특성(복잡도, 수렴성)은 어떤가?

주요 결과

  • CL은 기존 대체 손실보다 0-1 손실에 대한 더 촘촘한 상-bound를 제공하여 강건한 학습을 가능하게 한다.
  • 간단한 O(n log n) 알고리즘(알고리즘 1)은 미니배치 지원으로 커리큘럼 학습을 위한 샘플을 적응적으로 선택할 수 있다.
  • NPCL은 노이즈 비율 ε와 커리큘럼 프레임워크를 이용해 가능성이 높은 노이즈 샘플을 가지치기하여 높은 노이즈율에서 강건성을 향상시킨다.
  • 실험 결과 NPCL은 일반화된 교차 엔트로피(GCE)를 종종 능가하고 여러 설정에서 Co-teaching 방법과 일치하거나 이를 능가하며, 특히 더 강한 노이즈일 때 그렇다.
  • 이 접근법은 심층 모델용 플러그인 손실로 작동하며 배치 업데이트에서도 계산적으로 효율적이다.
  • MNIST, CIFAR-10/100, Tiny-ImageNet에서의 다양한 실험은 대칭 및 쌍별 라벨 손상 시나리오에서의 강건성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.