Skip to main content
QUICK REVIEW

[논문 리뷰] Mixture Proportion Estimation and PU Learning: A Modern Approach

Saurabh Garg, Yifan Wu|arXiv (Cornell University)|2021. 11. 01.
Machine Learning and Data Classification참고 문헌 44인용 수 5
한 줄 요약

이 논문은 혼합 비율 추정(MPE)과 PU 학습을 위한 최적의 비닝 추정(BBE)과 조건부 가치 忽시 리스크(CVIR)를 제안하며, 고차원 환경에서 정확한 양성 대 음성 분류를 가능하게 한다. BBE와 CVIR를 통합한 반복적 TED 프레임워크는 온건한 가정 하에 이론적 보장을 제공하며, 시각, 자연어 처리(NLP), 표 형태 데이터셋에서 기존 방법들을 능가하는 최고 성능을 기록한다.

ABSTRACT

Given only positive examples and unlabeled examples (from both positive and negative classes), we might hope nevertheless to estimate an accurate positive-versus-negative classifier. Formally, this task is broken down into two subtasks: (i) Mixture Proportion Estimation (MPE) -- determining the fraction of positive examples in the unlabeled data; and (ii) PU-learning -- given such an estimate, learning the desired positive-versus-negative classifier. Unfortunately, classical methods for both problems break down in high-dimensional settings. Meanwhile, recently proposed heuristics lack theoretical coherence and depend precariously on hyperparameter tuning. In this paper, we propose two simple techniques: Best Bin Estimation (BBE) (for MPE); and Conditional Value Ignoring Risk (CVIR), a simple objective for PU-learning. Both methods dominate previous approaches empirically, and for BBE, we establish formal guarantees that hold whenever we can train a model to cleanly separate out a small subset of positive examples. Our final algorithm (TED)$^n$, alternates between the two procedures, significantly improving both our mixture proportion estimator and classifier

연구 동기 및 목표

  • 고차원 데이터 하에서 기존의 히وري스틱 기반 방법과 최근의 히وري스틱 기반 방법의 한계를 해결하기 위해.
  • 초기 조정 없이도 이론적으로 탄탄한, 양성 예측의 비율을 추정하는 강력한 방법을 개발하기 위해 (MPE).
  • 고립된 양성 예측에 대한 과적합을 방지하기 위해 고손실 샘플을 제거함으로써, PU 학습 목표를 설계하기 위해.
  • MPE와 PU 학습을 반복적 프레임워크에 통합하여 혼합 비율 추정과 분류 정확도를 동시에 향상시키기 위해.
  • 특히 일부 양성 예측의 부분 집합이 분리 가능할 경우에 한하여, BBE에 대해 유한 표본 통계 보장을 수립하기 위해.

제안 방법

  • BBE는 특정 임계값 이하의 양성 대 비음성 예측 비율에 대한 상한 신뢰구간을 최소화하는 임계값을 식별하여 혼합 비율 α를 추정한다.
  • 이 방법은 양성 가능성에 대한 점수를 생성하기 위해 훈련된 양성 대 비음성(PvU) 분류기를 활용하며, 점수 분포의 단조성 캘리브레이션을 가정한다.
  • PU 학습을 위한 CVIR은 각 에포크마다 손실이 가장 높은 α 비율의 훈련 예측을 제거하여, 비음성 양성 예측에 대한 과적합을 줄인다.
  • TED 프레임워크는 BBE를 통한 MPE와 CVIR을 통한 PU 학습을 번갈아 수행하며, 혼합 비율 추정과 분류기 성능을 반복적으로 개선한다.
  • 이 방법은 깊은 신경망을 포함한 임의의 가설 클래스와 호환되며, 재캘리브레이션 또는 광범위한 초모수 조정이 필요하지 않다.
  • 이론적 분석 결과, BBE는 온건한 조건 하에서 O(1/√n) 수렴 속도를 확보하며, 특히 일부 양성 예측이 분리 가능한 부분 영역을 가질 경우에 유리하다.

실험 결과

연구 질문

  • RQ1기존 방법이 실패하는 고차원 환경에서 일관되고 이론적으로 탄탄한 혼합 비율 추정을 달성할 수 있는가?
  • RQ2초모수 조정 없이도 비음성 데이터에 대한 과적합에 강건한 PU 학습 목표를 설계할 수 있는가?
  • RQ3MPE와 PU 학습을 반복적 프레임워크에 통합하면 추정 성능와 분류 성능가 모두 크게 향상되는가?
  • RQ4BBE는 어떤 조건에서 최적의 통계 수렴 속도를 달성하며, 실질적으로 기존 MPE 방법들과 비교해 어떻게 성능을 냅니다?
  • RQ5제안된 방법들은 시각, 자연어 처리(NLP), 표 형태 데이터셋 등 다양한 데이터 유형에 대해, 특히 지원이 겹치는 경우에도 일반화 가능한가?

주요 결과

  • ResNet-18를 사용한 binary-CIFAR에서, TED는 기준 PvU 훈련 대비 분류 정확도와 MPE 추정 모두에서 뚜렷한 향상을 보였다.
  • UCI 데이터셋에서, TED는 가장 낮은 절대 추정 오차(0.001–0.007)와 가장 높은 정확도(버섯 데이터셋 98.7%, pageblock 데이터셋 95.7%)를 기록하여 모든 기준선을 압도했다.
  • 클래스 지원이 겹치는 MNIST Overlap에서, TED는 가장 낮은 MPE 오차(0.035)와 가장 높은 정확도(79.0%)를 기록하며 모든 경쟁자들을 능가했다.
  • BERT를 사용한 IMDb에서, TED는 87.6%의 정확도를 기록하여 다음으로 우수한 방법보다 1.4%포인트 높았다.
  • BBE는 다양한 α와 데이터 복잡도를 가진 데이터셋 간에서 일관된 추정 성능를 보이며, 유한 표본 보장을 확보했다.
  • CVIR 기반 훈련은 과적합에 강건했으며, α가 알려지지 않은 상황에서도 정확도가 지속적으로 향상되었으며, nnPU 및 uPU와 같은 방법들을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.