Skip to main content
QUICK REVIEW

[논문 리뷰] Positive-Unlabeled Learning using Random Forests via Recursive Greedy Risk Minimization

Jonathan Wilton, Abigail Koay|arXiv (Cornell University)|2022. 10. 16.
Machine Learning and Data Classification인용 수 9
한 줄 요약

이 논문은 의사결정트리 학습을 순환적 탐욕적 위험 최소화로 재해석하는 새로운 랜덤 포레스트 알고리즘인 PU Extra Trees를 제안한다. 이 알고리즘은 양성-무정의(PU) 학습을 위해 설계되었으며, PU 전용 위험 추정량(예: 비음수 PU 위험)을 직접 최소화함으로써 최소한의 하이퍼파라미터 튜닝으로도 뛰어난 성능을 달성한다. 또한, 각 특징이 위험 감소에 기여하는 정도를 수량화하는 특징 중요도 점수를 도입하여, 여러 데이터셋에서 최신 기술보다 뛰어난 성능을 발휘한다.

ABSTRACT

The need to learn from positive and unlabeled data, or PU learning, arises in many applications and has attracted increasing interest. While random forests are known to perform well on many tasks with positive and negative data, recent PU algorithms are generally based on deep neural networks, and the potential of tree-based PU learning is under-explored. In this paper, we propose new random forest algorithms for PU-learning. Key to our approach is a new interpretation of decision tree algorithms for positive and negative data as \emph{recursive greedy risk minimization algorithms}. We extend this perspective to the PU setting to develop new decision tree learning algorithms that directly minimizes PU-data based estimators for the expected risk. This allows us to develop an efficient PU random forest algorithm, PU extra trees. Our approach features three desirable properties: it is robust to the choice of the loss function in the sense that various loss functions lead to the same decision trees; it requires little hyperparameter tuning as compared to neural network based PU learning; it supports a feature importance that directly measures a feature's contribution to risk minimization. Our algorithms demonstrate strong performance on several datasets. Our code is available at \url{https://github.com/puetpaper/PUExtraTrees}.

연구 동기 및 목표

  • 딥 러닝 기반 접근 방식에 비해 아직 탐색이 부족한 트리 기반 모델의 양성-무정(PU) 학습 잠재력을 다루기 위해.
  • 순수도 기반 분할을 위험 최소화로 해석함으로써, PU 데이터에 직접적으로 의사결정트리를 훈련할 수 있는 원리적인 프레임워크를 개발하기 위해.
  • 이 프레임워크를 랜덤 포레스트로 확장하여, 최소한의 하이퍼파라미터 튜닝으로도 효율적인 PU 학습 알고리즘을 만들기 위해.
  • PU 설정에서 기대 위험을 최소화하는 데 기여하는 특징의 기여도를 직접 반영하는 새로운 특징 중요도 메트릭을 도입하기 위해.
  • 트리 기반 PU 학습이 최신 신경망 기반 PU 방법과 경쟁 가능한 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 표준 순수도 기반 의사결정트리 학습을 특정 손실 함수를 사용한 경험적 위험 최소화로 재해석하는 순환적 탐욕적 위험 최소화 프레임워크를 제안한다.
  • 비음수 PU 위험(nnPU) 기반의 위험 추정량을 설계하여, PU 학습에 이를 확장함으로써 PU 데이터에서 기대 위험을 직접 최소화할 수 있도록 한다.
  • 순수도 감소가 아닌 PU 위험 감소가 가장 큰 분할을 선택하는 새로운 의사결정트리 알고리즘을 개발하며, 이는 제곱 손실 또는 로지스틱 손실과 같은 손실 함수를 사용한다.
  • 부트스트래핑 샘플링과 특징 부분 샘플링을 통해 다수의 PU 의사결정트리를 조합함으로써 랜덤 포레스트 변형인 PU Extra Trees를 구축함으로써, 강건성과 일반화 능력을 확보한다.
  • 모델의 전체 위험 감소에 기여하는 각 특징의 기여도를 수량화하는 위험 감소 기반 특징 중요도 점수를 도입한다.
  • 위험 감소 임계값 또는 최대 트리 크기를 기반으로 한 정지 기준을 적용하여, 히وري스틱한 과적합 제어 방식에 대한 원리적인 대안을 제공한다.

실험 결과

연구 질문

  • RQ1양성-음성 및 양성-무정 데이터 모두에 대해 의사결정트리 학습을 순환적 탐욕적 위험 최소화로 재해석할 수 있는가?
  • RQ2PU 전용 위험 추정량을 직접 최소화하는 것이 기존의 순수도 기반 분할 방식보다 PU 학습에서 더 나은 성능을 내는가?
  • RQ3트리 기반 PU 학습 방법이 상당히 적은 하이퍼파라미터 튜닝으로 최신 딥 러닝 모델 수준의 성능을 달성할 수 있는가?
  • RQ4제안된 위험 기반 특징 중요도 점수는 PU 설정에서 기존 중요도 메트릭보다 더 해석 가능하고 의미 있는가?
  • RQ5제안된 방법은 다양한 손실 함수에 대해 얼마나 강건한가? 그리고 다양한 데이터셋에서 일관된 성능을 유지하는가?

주요 결과

  • PU Extra Trees는 UNSW-NB15 및 MNIST와 같은 여러 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하며, AUC와 정확도 점수 모두 경쟁력 있는 성능을 보였다.
  • UNSW-NB15 데이터셋에서 PU Extra Trees는 AUC 85.65 (0.59)를 기록하여 AUC 및 F1 점수 측면에서 다른 PU 및 PN 기반 모델보다 뛰어난 성능을 보였다.
  • 제안된 위험 감소 기반 특징 중요도 점수는 표준 PN 랜덤 포레스트의 결과와 시각적·정성적으로 유사하여, PU 모델이 유사하고 의미 있는 표현을 학습하고 있음을 시사한다.
  • 손실 함수 선택에 대해 강건함을 입증: 제곱 손실, 로지스틱 손실 등 다양한 손실 함수를 사용해도 동일한 의사결정트리가 생성되어 모델 구조의 안정성을 보였다.
  • 신경망 기반 PU 방법에 비해 최소한의 하이퍼파라미터 튜닝으로도 가능하여, 실세계 적용에 더 실용적임을 입증했다.
  • 특징 중요도 점수는 직관적인 패턴과 일치한다 — 예를 들어 MNIST에서는 높은 중요도를 가진 픽셀이 숫자의 형태에 해당하며, 이는 그 해석 가능성과 관련성의 타당성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.