Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Positive Unlabeled Learning: Practical AUL Estimation and New Training Method for Extremely Imbalanced Data Sets

Liwei Jiang, Dan Li|arXiv (Cornell University)|2020. 04. 21.
Imbalanced Data Classification Techniques참고 문헌 28인용 수 7
한 줄 요약

이 논문은 비정상적인 클래스 불균형 상황에서의 Positive-Unlabeled (PU) 학습을 위한 실용적인 AUL 추정 방법을 제안하며, 비정상적인 샘플에 대한 사전 지식이 필요로 하지 않으며, 극도로 불균형한 PU 데이터셋을 위한 새로운 훈련 방법인 ProbTagging을 도입한다. ProbTagging은 유사도 기반의 확률적 레이블링을 통해 비정상 샘플에 대해 다수의 합성 PN 데이터셋을 생성하고, 이를 기반으로 앙상블 모델을 훈련함으로써 산업계 및 인공 PU 데이터셋에서 최신 기법 대비 최대 10%의 AUC 향상을 달성한다.

ABSTRACT

Positive Unlabeled (PU) learning is widely used in many applications, where a binary classifier is trained on the datasets consisting of only positive and unlabeled samples. In this paper, we improve PU learning over state-of-the-art from two aspects. Firstly, existing model evaluation methods for PU learning requires ground truth of unlabeled samples, which is unlikely to be obtained in practice. In order to release this restriction, we propose an asymptotic unbiased practical AUL (area under the lift) estimation method, which makes use of raw PU data without prior knowledge of unlabeled samples. Secondly, we propose ProbTagging, a new training method for extremely imbalanced data sets, where the number of unlabeled samples is hundreds or thousands of times that of positive samples. ProbTagging introduces probability into the aggregation method. Specifically, each unlabeled sample is tagged positive or negative with the probability calculated based on the similarity to its positive neighbors. Based on this, multiple data sets are generated to train different models, which are then combined into an ensemble model. Compared to state-of-the-art work, the experimental results show that ProbTagging can increase the AUC by up to 10%, based on three industrial and two artificial PU data sets.

연구 동기 및 목표

  • 비정상 샘플에 대한 진정한 레이블이 없기 때문에 PU 학습에서 신뢰할 수 있는 모델 평가가 어려운 문제를 해결하기 위해.
  • 비정상 샘플에 비해 정상 샘플이 극히 적은 극도의 클래스 불균형 상황에서 PU 학습의 성능을 향상시키기 위해.
  • 레이블이 부여된 음성 샘플이 필요로 하지 않으면서도 데이터 효율성과 모델의 강건성을 향상시키는 훈련 방법을 개발하기 위해.
  • 클래스 사전 지식이나 PN 테스트 세트에 의존하지 않고도 원시 PU 데이터만을 사용하여 실용적이고 편향이 없는 평가 지표인 AUL을 제공하기 위해.

제안 방법

  • 클래스 사전 지식이나 비정상 샘플에 대한 진정한 레이블이 필요로 하지 않고 원시 PU 데이터만을 사용하여 渐近적으로 편향이 없는 AUL 추정 방법을 제안한다.
  • 비정상 샘플에 대해 알려진 정상 샘플과의 유사도 기반으로 확률적 양성/음성 레이블을 할당하는 훈련 프레임워크인 ProbTagging을 도입한다.
  • k-NN를 사용하여 비정상 샘플과 정상 샘플 간의 유사도를 계산하고, 유사도 비례로 양성 레이블을 확률적으로 할당한다.
  • 확률적 레이블링에서 샘플링을 통해 다수의 합성 PN 데이터셋을 생성함으로써 다양한 기본 모델을 훈련시킬 수 있도록 한다.
  • 합성 데이터셋에 기반해 훈련된 다수의 모델을 앙상블 평균화하여 일반화 및 강건성을 향상시킨다.
  • 구현에서는 기반 분류기로 GBDT를 사용하고, 유사도 계산에는 k-NN를 사용한다.

실험 결과

연구 질문

  • RQ1비정상 클래스 분포나 진정한 레이블에 대한 사전 지식이 없이도 PU 학습에서 AUL을 신뢰성 있게 추정할 수 있는가?
  • RQ2PN 레이블이 부여된 테스트 세트에 접근할 수 없는 상황에서 원시 PU 데이터만을 사용할 때 모델 성능을 효과적으로 평가할 수 있는가?
  • RQ3비정상 샘플에 대한 유사도 기반의 확률적 레이블링을 통해 정상 샘플의 효과적 수를 증가시켜 극도의 클래스 불균형 문제를 완화할 수 있는가?
  • RQ4정상 샘플과의 유사도 기반으로 비정상 샘플에 대해 확률적 레이블을 할당하는 것이 모델의 일반화 능력과 AUC 성능 향상에 기여하는가?
  • RQ5실제 산업계 PU 데이터셋에서 흔히 발생하는 높은 노이즈와 낮은 정상 샘플 비율 조건에서 제안된 방법의 성능은 어떠한가?

주요 결과

  • 제안된 AUL 추정 방법은 클래스 사전 지식이 없더라도 해당 PN 데이터 기반으로 진짜 AUC를 渐近적으로 편향 없이 추정할 수 있다.
  • ProbTagging은 산업계 3종 및 인공 2종의 PU 데이터셋에서 최신 기법 대비 최대 10%의 AUC 향상을 달성한다.
  • θ₀ = 0.5인 APS 및 신용카드 사기 데이터셋에서 ProbTagging은 각각 AUC 0.9921과 0.9757을 기록하며, Elkan의 방법과 BaggingPU를 모두 능가한다.
  • ProbTagging는 높은 노이즈(큰 1−θ₀) 조건에서도 강력한 성능 유지를 보이며, 다른 방법들이 심각하게 성능 저하를 보이는 극도로 불균형한 환경에서도 강건성을 확보한다.
  • nnPU와 PU-AUC는 희귀한 정상 샘플이 위험 추정에 기여하는 데에 부족하여 극도로 불균형한 데이터에서 열악한 성능을 보인다.
  • ProbTagging의 앙상블 방식은 동일한 정상 샘플을 사용하는 BaggingPU와 달리 기저 모델 간 상관관계가 높아지지 않아 분산을 더 효과적으로 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.