Skip to main content
QUICK REVIEW

[논문 리뷰] Learning with Confident Examples: Rank Pruning for Robust Classification with Noisy Labels

Curtis G. Northcutt, Tailin Wu|arXiv (Cornell University)|2017. 05. 04.
Machine Learning and Data Classification인용 수 68
한 줄 요약

Rank Pruning (RP) 은 노이즈 라벨이 있는 이진 분류에 대해 비대칭 노이즈 비율을 추정하고 자신감 있는 예측을 이용해 잘못 라벨링된 예제를 제거함으로써 시간 효율적인 해결책을 제공하며, 이상적 조건에서 깨끗한 라벨 학습과 동일한 위험을 달성한다.

ABSTRACT

Noisy PN learning is the problem of binary classification when training examples may be mislabeled (flipped) uniformly with noise rate rho1 for positive examples and rho0 for negative examples. We propose Rank Pruning (RP) to solve noisy PN learning and the open problem of estimating the noise rates, i.e. the fraction of wrong positive and negative labels. Unlike prior solutions, RP is time-efficient and general, requiring O(T) for any unrestricted choice of probabilistic classifier with T fitting time. We prove RP has consistent noise estimation and equivalent expected risk as learning with uncorrupted labels in ideal conditions, and derive closed-form solutions when conditions are non-ideal. RP achieves state-of-the-art noise estimation and F1, error, and AUC-PR for both MNIST and CIFAR datasets, regardless of the amount of noise and performs similarly impressively when a large portion of training examples are noise drawn from a third distribution. To highlight, RP with a CNN classifier can predict if an MNIST digit is a "one"or "not" with only 0.25% error, and 0.46 error across all digits, even when 50% of positive examples are mislabeled and 50% of observed positive labels are mislabeled negative examples.

연구 동기 및 목표

  • 비대칭 라벨 노이즈($\tilde{P}\tilde{N}$ 학습)를 가진 이진 분류 문제를 동기 부여하고 형식화합니다.
  • 노이즈 비율 $\rho_1$ 및 $\rho_0$ 를 추정하고 잘못 라벨링된 예제를 제거하기 위해 Rank Pruning(RP) 을 제안합니다.
  • 일관된 노이즈 추정과 이상적 조건에서 깨끗한 라벨 학습과 동일한 기대 위험을 달성함을 보여주고, 비이상적 조건의 경우에는 해를 닫힌 형식으로 제시합니다.
  • MNIST, CIFAR와 같은 데이터세트 및 LR, CNN과 같은 분류기에서 RP의 확장성 및 견고성을 입증합니다.
  • RP가 효율성을 희생하지 않으면서 F1, AUC-PR, 그리고 오차를 향상시킨다는 이론적 보장과 실증적 근거를 제공합니다.

제안 방법

  • 예측 라벨의 자신감 있는 개수에서 비대칭 노이즈 비율 $\rho_1$ 및 $\rho_0$ 를 추정하여 강건한 샘플 외 추정치를 얻습니다.\n1
  • 모델 예측에서 LB 및 UB 임계값을 계산하여 손상된 데이터를 확신되는 올바름/오류의 하위집합으로 구분합니다.
  • BFPRT 를 사용하여 해당 부분집합의 비율의 $\tilde{P}$ 와 $\tilde{N}$ 를 제거하여 $\,O(n)$ 시간에 $\tilde{P}_{conf}$ 와 $\tilde{N}_{conf}$ 를 얻습니다.
  • 추정된 노이즈의 보상을 위해 클래스 조건 가중치를 사용하여 확신 있는 부분집합에서 분류기를 재적합합니다.
  • 범위 분리성(range separability) 하에서 RP 가 깨끗한 라벨로 학습하는 것과 동일한 기대 위험을 산출함을 보인다 (정리 5).
  • 비이상적 케이스에 대한 닫힌 형태의 해를 제공하고 이상적/비이상적 조건에서의 일치를 확립합니다(보조정리/정리).

실험 결과

연구 질문

  • RQ1RP 가 손상된 라벨로부터 비대칭 노이즈 비율 $\rho_1$ 및 $\rho_0$ 를 정확하게 추정할 수 있는가?
  • RQ2RP 가 이상적 조건에서 깨끗한 라벨 학습과 동일한 기대 위험을 산출하는가?
  • RQ3g 가 이상적이지 않거나 P 와 N 가 겹치는 지지를 가질 때 RP 의 성능은 어떠한가?
  • RQ4RP 는 대규모 데이터세트와 복잡한 분류기에 대해 시간 효율적이고 확장 가능한가?
  • RQ5MNIST, CIFAR 및 다양한 노이즈 수준에서 표준 지표(F1, AUC-PR, Error)를 향상시키는가?

주요 결과

  • RP 는 $\tilde{P}\tilde{N}$ 데이터에서 견고하고 시간 효율적인 노이즈 비율 추정을 달성합니다.
  • 이상적 조건에서 RP 의 노이즈 추정은 정확하고 결과 위험은 실제 라벨로 학습하는 것과 동일합니다.
  • g 가 불완전해도 RP 는 강건성을 유지하며 비이상적 시나리오에 대한 닫힌 형태의 조정을 제공합니다.
  • 실험적으로 RP 는 MNIST 와 CIFAR 에서 다른 노이즈 수준과 제3의 분포에서 추가된 노이즈에 대해 최첨단 F1, AUC-PR, 그리고 Error 를 달성합니다.
  • MNIST의 CNN 에서, RP 는 상당한 라벨 노이즈(예: 50% 잘못 라벨링) 하에서 one-vs-not-one 에 대해 0.25% 오차, 전체적으로 0.46% 오차에 도달할 수 있습니다.
  • RP 는 데이터 크기, 특징 차원, 노이즈 비율에 따라 확장되며, O(T) 적합 시간과 선형 가지치기 복잡성을 유지합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.