Skip to main content
QUICK REVIEW

[논문 리뷰] A bagging SVM to learn from positive and unlabeled examples

Fantine Mordelet, Jean‐Philippe Vert|arXiv (Cornell University)|2010. 10. 05.
Machine Learning and Data Classification참고 문헌 19인용 수 8
한 줄 요약

이 논문은 양성-무단일(positive-unlabeled, PU) 학습을 위한 새로운 방법인 bagging SVM를 제안한다. 이 방법은 무단일 데이터의 무작위 부분집합으로 훈련된 여러 SVM을 통합함으로써 분류기의 안정성을 향상시킨다. 기존의 PU 학습 방법보다 성능이 뛰어나거나 동등하며, 특히 무단일 예제의 수가 양성 예제의 수보다 훨씬 많을 경우에 훨씬 더 빠른 속도를 보인다.

ABSTRACT

We consider the problem of learning a binary classifier from a training set of positive and unlabeled examples, both in the inductive and in the transductive setting. This problem, often referred to as \emph{PU learning}, differs from the standard supervised classification problem by the lack of negative examples in the training set. It corresponds to an ubiquitous situation in many applications such as information retrieval or gene ranking, when we have identified a set of data of interest sharing a particular property, and we wish to automatically retrieve additional data sharing the same property among a large and easily available pool of unlabeled data. We propose a conceptually simple method, akin to bagging, to approach both inductive and transductive PU learning problems, by converting them into series of supervised binary classification problems discriminating the known positive examples from random subsamples of the unlabeled set. We empirically demonstrate the relevance of the method on simulated and real data, where it performs at least as well as existing methods while being faster.

연구 동기 및 목표

  • 정보 검색 및 유전자 랭킹과 같은 분야에서 흔히 발생하는, 양성 예제와 무단일 예제만 제공되는 경우에 이진 분류기 학습 문제를 해결한다.
  • 무단일 데이터의 오염 비율이 변동하는 상황에서 표준 PU 학습 방법의 불안정성을 앙상블 기법을 활용해 극복한다.
  • 훈련 시간을 줄이며 높은 성능을 유지하는 편향된 SVM의 계산 효율적인 대안을 개발한다.
  • 모의 및 실제 데이터셋을 대상으로 유도적(inductive) 및 전도적(transductive) 설정에서 성능을 평가하여 안정성과 확장성의 타당성을 검증한다.

제안 방법

  • 기존의 양성 예제와 무단일 집합의 무작위 부분집합을 사용해 여러 SVM을 훈련시는 bagging 유사 프레임워크를 제안한다.
  • 개별 분류기의 편향과 분산을 균형 잡기 위해 무단일 부분집합의 크기 K를 제어하며, 기본 설정으로 K = |P|를 사용한다.
  • T개의 개별 SVM의 예측을 통합해 최종 점수 함수를 형성함으로써 안정성과 일반화 성능을 향상시킨다.
  • 예측을 무단일 집합으로 국한시켜 전도적 PU 학습에 이 방법을 적용한다.
  • 각 기본 분류기가 양성 예제의 균형 잡힌 부분집합과 무단일 데이터의 랜덤 부분집합을 기반으로 훈련되도록 대칭적 bagging 전략을 사용한다.
  • 반복적 재가중 또는 복잡한 최적화가 필요로 하지 않으며, 기본 모델의 단순 앙상블 평균화에 의존한다.

실험 결과

연구 질문

  • RQ1백업을 통한 앙상블 학습이 비점근적 설정에서 PU 학습의 안정성과 성능을 향상시킬 수 있는가?
  • RQ2무작위 무단일 부분집합의 크기 K가 최종 분류기 성능와 계산 비용에 어떤 영향을 미치는가?
  • RQ3bagging SVM이 정확도와 속도 측면에서 편향된 SVM과 같은 최첨단 PU 학습 방법보다 뛰어나거나 동등한가?
  • RQ4몇 개의 양성 예제만 존재할 경우, PU 학습이 일격성 SVM보다 성능이 뛰어나지는 경우는 언제인가?
  • RQ5|U| >> |P| 조건에서 bagging SVM이 편향된 SVM보다 현저히 빠른 상황은 언제인가?

주요 결과

  • 모의 데이터에서 bagging SVM는 편향된 SVM와 비교해 유사하거나 뛰어난 성능을 보였으며, 실제 데이터셋에서는 유의미한 차이가 없었다.
  • 20 Newsgroups 데이터셋에서 T=35, K=10 조건에서 bagging SVM는 AUC 0.921, AUP 0.531을 기록했고, 편향된 SVM는 227초 동안 AUC 0.932, AUP 0.491를 달성했다.
  • T=200, K=200 조건에서 bagging SVM는 473초가 소요되었고, 편향된 SVM는 227초가 걸려 |U|/|P| > 6일 경우 bagging SVM가 더 빠른 것으로 나타났다.
  • K의 변화에 대해 안정적인 성능을 보였으며, K = |P|는 성능와 계산 부담을 균형 잡는 데 안전한 기본 설정으로 부상했다.
  • 20 Newsgroups 벤치마크에서 양성 예제가 10개 미만일 경우, 일격성 SVM가 PU 방법보다 뛰어난 성능을 보여, PU 학습이 항상 슈퍼리어하지 않음을 시사했다.
  • |U|/|P| 비율이 커질수록 bagging SVM의 계산적 이점이 커지며, 이는 무단일 예제가 양성 예제보다 훨씬 많은 대규모 응용 분야에서 특히 효율적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.