Skip to main content
QUICK REVIEW

[논문 리뷰] Nonparametric semi-supervised learning of class proportions

Shantanu Jain, Martha White|arXiv (Cornell University)|2016. 01. 08.
Machine Learning and Data Classification참고 문헌 34인용 수 18
한 줄 요약

이 논문은 두 성분 혼합 모형에서 혼합 비율을 추정하는 문제로 포지티브-언패럴러드 학습에서 클래스 비율을 추정하기 위한 비모수적 준지도 학습 방법을 제안한다. 유일성 보장을 위해 최대-표준형을 도입하고 고차원 데이터를 다룰 수 있도록 클래스 사전 확률를 유지하는 변환을 사용한 최대우도 추정 기반 알고리즘을 개발하여, 합성 및 실세계 데이터셋에서 최신 기법들보다 뛰어난 정확도를 달성한다.

ABSTRACT

The problem of developing binary classifiers from positive and unlabeled data is often encountered in machine learning. A common requirement in this setting is to approximate posterior probabilities of positive and negative classes for a previously unseen data point. This problem can be decomposed into two steps: (i) the development of accurate predictors that discriminate between positive and unlabeled data, and (ii) the accurate estimation of the prior probabilities of positive and negative examples. In this work we primarily focus on the latter subproblem. We study nonparametric class prior estimation and formulate this problem as an estimation of mixing proportions in two-component mixture models, given a sample from one of the components and another sample from the mixture itself. We show that estimation of mixing proportions is generally ill-defined and propose a canonical form to obtain identifiability while maintaining the flexibility to model any distribution. We use insights from this theory to elucidate the optimization surface of the class priors and propose an algorithm for estimating them. To address the problems of high-dimensional density estimation, we provide practical transformations to low-dimensional spaces that preserve class priors. Finally, we demonstrate the efficacy of our method on univariate and multivariate data.

연구 동기 및 목표

  • 부정 예제가 확보되지 않거나 확보가 불가능한 상황에서 포지티브-언패럴러드 학습에서 클래스 사전 확률 추정 문제를 해결하기 위해.
  • 클래스 사전 확률 추정을 두 성분 혼합 모형에서 혼합 비율을 학습하는 비모수적 문제로 공식화하기 위해.
  • 유일성 보장을 위해 구성 밀도에 대한 비모수적 가정 없이도 혼합 비율 추정의 유일성을 보장하는 표준형을 도입함으로써 문제를 해결하기 위해.
  • 차원 감소를 통해 클래스 사전 확률를 유지하는 변환을 활용하여 고차원 밀도 추정 기법을 개발하고 실용적으로 적용하기 위해.
  • 일변량 및 다변량 데이터에서 기존 최신 기법들과의 비교를 통해 제안된 방법의 실증적 타당성을 검증하기 위해.

제안 방법

  • 클래스 사전 확률 추정 문제를 두 성분 혼합 모형에서 혼합 비율 α를 학습하는 문제로 공식화: f(x) = αf₁(x) + (1−α)f₀(x), 여기서 f₁은 양성 데이터로부터 알려져 있고 f는 비라벨 데이터로부터 추정된다.
  • 혼합 밀도와 구성 밀도의 최대값이 공통된 점에서 일치하도록 정규화함으로써 유일성을 강제하는 최대-표준형을 도입한다.
  • 표준형 기반의 우도 함수를 유도하고, 표준형 공간에서의 로그우도의 볼록성 성질을 활용하여 α를 최적화하기 위해 최대우도 추정을 사용한다.
  • 고차원 데이터를 일변량 공간으로 투영하여 밀도 추정이 가능하고 정확한, 분류기 점수 등의 클래스 사전 확률를 유지하는 변환을 제안한다.
  • 비모수적 밀도 추정을 위해 투영된 공간에서 커널 밀도 추정을 사용하며, 밴드폭 선택은 교차검증 또는 플러그인 방법에 의해 이끌린다.
  • 로그우도 플롯을 활용하여 굴곡점(Inflection point)을 탐지함으로써 최적의 α를 추정하며, 노이즈가 많은 환경에서의 안정성을 향상시키기 위한 히우리스틱을 제시한다.

실험 결과

연구 질문

  • RQ1두 성분 혼합 모형에서 혼합 비율 추정 문제를 구성 밀도에 대한 모수적 가정 없이도 유일성 보장이 가능할 수 있는가?
  • RQ2밀도 추정이 비가역적인 고차원 환경에서 비모수적 클래스 사전 확률 추정이 어떻게 강건하게 유지될 수 있는가?
  • RQ3차원 감소를 통해 효과적인 추정을 가능하게 하면서도 클래스 사전 확률를 유지하는 변환 전략은 무엇인가?
  • RQ4제안된 방법은 기존의 지도 학습 및 비지도 학습 기법들에 비해 클래스 사전 확률 추정 정확도에서 어떻게 비교되는가?
  • RQ5최대-표준형이 α의 일致한 추정을 보장하는 이론적 및 실증적 조건은 무엇인가?

주요 결과

  • 제안된 AlphaMax 방법은 12개의 UCI 데이터셋에서 평균 절대오차(MAE)가 가장 낮게 나타났으며, 12개 데이터셋 중 10개에서 MAE 값이 항상 0.05 이하로 유지되었고, 12개 비교 중 9개에서 통계적으로 유의미하게 뛰어난 성능을 보였다.
  • Waveform 및 ball-in-the-box 데이터셋에서 α=0.05일 때 AlphaMax는 MAE 값이 각각 0.004와 0.004를 기록하여 pdf 비율 및 cdf 기반 방법보다 유의미하게 뛰어났다(p<0.05).
  • Gas(127개 특성) 및 Spambase(57개 특성)와 같은 고차원 데이터에서는 AlphaMax가 각각 MAE 0.018과 0.066을 기록하여 pdf 비율 방법(0.335 및 0.116)과 cdf 기반 방법(0.137 및 0.027)을 모두 압도했다.
  • 최대-표준형은 원래 혼합 모형이 유일성이 없더라도 α의 안정적이고 유일한 추정을 가능하게 하였으며, 이론적 및 실증적 검증을 통해 유일성 보장을 입증하였다.
  • 편향되거나 다중모달인 밀도 분포를 포함한 다양한 데이터 분포에서 뛰어난 강건성을 보였으며, α 값이 0.05에서 0.95에 이르는 범위에서도 일관된 성능을 유지하였다.
  • 분류기 점수 기반 변환을 사용함으로써 클래스 사전 확률를 효과적으로 유지하였으며, 직접적인 다변량 밀도 추정이 실패하는 고차원 환경에서도 정확한 추정이 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.