Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing binary classifiers using only positive and unlabeled data

Marc Claesen, Jesse Davis|arXiv (Cornell University)|2015. 01. 01.
Machine Learning and Data Classification참고 문헌 31인용 수 7
한 줄 요약

이 논문은 음성 데이터에 포함된 잠재적 양성 비율을 추정함으로써, 오직 양성 및 무 nhãn 데이터만을 사용하여 이진 분류기 성능 지표(예: ROC 및 PR 곡선)를 추정하는 방법을 제안한다. 이 방법은 순위 분포 분석을 통해 기각률에 대한 하한 및 상한을 구축하여, 완전히 레이블링된 테스트 세트가 없어도 신뢰할 수 있는 평가가 가능하게 하며, 실제 데이터에서의 실험적 검증을 통해 정확한 곡선 추정을 입증한다.

ABSTRACT

Assessing the performance of a learned model is a crucial part of machine learning. However, in some domains only positive and unlabeled examples are available, which prohibits the use of most standard evaluation metrics. We propose an approach to estimate any metric based on contingency tables, including ROC and PR curves, using only positive and unlabeled data. Estimating these performance metrics is essentially reduced to estimating the fraction of (latent) positives in the unlabeled set, assuming known positives are a random sample of all positives. We provide theoretical bounds on the quality of our estimates, illustrate the importance of estimating the fraction of positives in the unlabeled set and demonstrate empirically that we are able to reliably estimate ROC and PR curves on real data.

연구 동기 및 목표

  • 표준 지표가 완전히 레이블링된 테스트 세트가 필요로 하므로, 오직 양성 및 무 nhãn 예제만 제공될 때 이진 분류기 평가에 직면하는 과제를 해결하기 위해.
  • 무 nhãn 데이터에 대한 진정한 레이블에 접근할 수 없을 때도 AUC, 정밀도 및 재현율과 같은 성능 지표의 추정을 가능하게 하는 방법을 개발하기 위해.
  • 무 nhãn 집합 내 양성 비율 추정치와 함께 예측 순위만을 사용하여 기각률에 대한 이론적 하한 및 상한을 제공하기 위해.
  • 모든 무 nhãn 데이터를 음성으로 간주하는 단순한 가정이 잘못된 모델 선택을 초래할 수 있음을 입증하고, 더 세밀한 평가의 필요성을 강조하기 위해.

제안 방법

  • 기존의 양성 예제의 순위 분포에 기반한 부트스트랩 기반 신뢰구간을 사용하여 무 nhãn 집합 내 잠재적 양성 비율(β)을 추정한다.
  • 전체 순위 내에서 기존 양성 예제의 순위 누적분포함수(CDF)를 분석함으로써 각 순위에서 기각률에 대한 하한 및 상한을 구축한다.
  • 이 하한 및 상한에서 유도된 교차표를 통해 불확실성 하에 진짜 양성 비율, 기각률, 정밀도 및 재현율을 추정할 수 있다.
  • 기존 양성 예제의 순위 CDF를 사용하여 가짜 양성 집합을 추론하고 성능 지표를 통해 불확실성을 전파한다.
  • 추정된 β를 매개변수로 삼아 ROC 및 PR 곡선에 대한 하한 및 상한을 수립하며, 민감도 분석을 통해 AUC에 비균일한 영향을 보여준다.
  • 실제 데이터(covtype)를 사용하여 검증하며, 다양한 β 추정치 하에서 추정된 하한 및 상한을 진짜 곡선과 비교한다.

실험 결과

연구 질문

  • RQ1오직 양성 및 무 nhãn 데이터만 존재할 때 AUC, 정밀도 및 재현율과 같은 성능 지표를 신뢰성 있게 추정할 수 있는가?
  • RQ2무 nhãn 집합 내 잠재적 양성 비율에 대한 불확실성이 추정된 성능 지표의 신뢰성에 어떤 영향을 미치는가?
  • RQ3무 nhãn 예제의 진짜 레이블이 알려지지 않았을 때 기각률에 대한 이론적 하한 및 상한은 무엇인가?
  • RQ4모든 무 nhãn 예제를 음성으로 간주하는 것이 잘못된 모델 선택을 초래하는가? 만약 그렇다면 이를 어떻게 방지할 수 있는가?
  • RQ5잠재적 양성 비율 β의 다양한 추정치를 사용할 때 추정된 ROC 및 PR 곡선은 진짜 곡선과 어떻게 비교되는가?

주요 결과

  • 이 방법은 오직 양성 및 무 nhãn 데이터만을 사용하여 ROC 및 PR 곡선을 성공적으로 추정하였으며, covtype 데이터셋에서 진짜 성능 곡선에 매우 가까운 하한 및 상한을 제공하였다.
  • β를 49%로 추정했을 때, 모델 1의 추정 AUC는 75.5%였고 진짜 값인 72.5%와 유사했으며, 모델 2의 경우 추정 AUC는 74.7%였고 진짜 값인 73.2%에 근접하여 높은 경험적 정확도를 보였다.
  • β의 신뢰구간(0.8β에서 1.2β)이 실제 잠재적 양성 예제의 순위 CDF를 포함하여 부트스트랩 추정 방법의 타당성을 검증하였다.
  • PR 공간에서의 추정은 ROC 공간보다 β 추정 오차에 더 민감했으며, 이는 정밀도가 클래스 균형에 의존하기 때문이다.
  • 기존의 음성 예제가 가짜 양성 할당의 자유도를 줄여 추정 품질을 약간 향상시키지만, 실질적으로는 이로 인한 이점은 미미하다.
  • 많은 음성 예제가 존재할 경우 β 대신 1−β를 사용하여 레이블을 뒤집는 것이 성능 하한을 향상시킬 수 있으며, 이는 향후 개선을 위한 레이블 뒤집기 전략의 잠재적 가능성임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.