Skip to main content
QUICK REVIEW

[논문 리뷰] Learning from Positive and Unlabeled Data under the Selected At Random Assumption

Jessa Bekker, Jesse Davis|arXiv (Cornell University)|2018. 08. 27.
Machine Learning and Data Classification참고 문헌 17인용 수 13
한 줄 요약

이 논문은 선택된 랜덤(Selected At Random, SAR) 가정 하에서 양성 및 미표기 데이터로부터 학습하는 데 기반한 EM 기반 방법인 SAR-EM을 제안한다. 여기서 양성 예제가 레이블링될 확률은 그 예제의 특성(유인도수)에 따라 달라진다. 이 방법은 강한 SCAR 가정을 따르는 기존 최고 수준의 방법들보다 우수한 성능을 보이며, 진정한 유인도수를 알지 못하는 경우에도 거의 최적에 가까운 성능을 달성하여 강한 SCAR 가정 위반에 대해 뛰어난 내구성을 보여준다.

ABSTRACT

For many interesting tasks, such as medical diagnosis and web page classification, a learner only has access to some positively labeled examples and many unlabeled examples. Learning from this type of data requires making assumptions about the true distribution of the classes and/or the mechanism that was used to select the positive examples to be labeled. The commonly made assumptions, separability of the classes and positive examples being selected completely at random, are very strong. This paper proposes a weaker assumption that assumes the positive examples to be selected at random, conditioned on some of the attributes. To learn under this assumption, an EM method is proposed. Experiments show that our method is not only very capable of learning under this assumption, but it also outperforms the state of the art for learning under the selected completely at random assumption.

연구 동기 및 목표

  • 선택 완전 랜덤(Selected Completely At Random, SCAR) 가정과 같은 강력한 가정의 한계를 해결하기 위해, 모든 양성 예제가 동일한 레이블링 확률을 가진다고 가정하는 것과 같은 강력한 가정을 완화하고자 한다.
  • 레이블링 확률이 일부 특성(유인도수)에 따라 달라지는 더 약한, 더 현실적인 가정인 선택된 랜덤(SAR)을 제안하고자 한다.
  • 진정한 유인도수를 사전에 알지 못해도 작동하는 효과적인 EM 기반 알고리즘인 SAR-EM을 개발하고자 한다.
  • 실증적으로 SAR-EM이 진정한 유인도수를 알고 있을 때와 거의 동일한 성능을 내며, 잘못된 SCAR 가정을 적용할 경우 성능이 떨어짐을 검증하고자 한다.

제안 방법

  • SAR 가정은 알려진 특성의 부분집합에 따라 레이블링 확률을 모델링하며, 이는 예제마다 다를 수 있는 유인도수를 도입한다.
  • SAR-EM 알고리즘은 기대최대화(Expectation-Maximization) 프레임워크를 사용한다: E단계에서는 각 미표기 예제가 양성일 가능성의 사후확률을 추정하고, M단계에서는 분류기와 유인도수 모델을 갱신한다.
  • 문제를 각 유인도수 관련 특성 조합에 대응하는 SCAR 문제의 혼합으로 간주함으로써, 국소적으로 클래스 사전확률을 추정할 수 있도록 한다.
  • 반복적인 개선을 통해 분류기와 유인도수 함수를 동시에 학습시켜 예측 정확도와 유인도수 추정 모두를 향상시킨다.
  • 진정한 유인도수를 알고 있는지 여부에 따라 평가되며, SAR-e(알려진 경우)와 SAR-EM(모르는 경우)를 포함한다.
  • 실제 데이터셋 여러 개에 대해 SCAR 가정에서 벗어나는 정도가 다른 상황에서 적용하여 내구성 검증을 수행한다.

실험 결과

연구 질문

  • RQ1SCAR 가정 위반에 대해 강건한 PU 학습 방법을 개발할 수 있는가? 특히 양성 예제 간 레이블링 확률이 일정하지 않을 경우.
  • RQ2진정한 레이블링 메커니즘이 알려져 있거나 알려져 있지 않을 경우, SAR-EM의 성능은 최고 수준의 방법들과 어떻게 비교되는가?
  • RQ3진정한 메커니즘이 SAR일 때 SCAR를 가정하면 분류기 성능이 떨어지며, 그 정도는 어느 정도인가?
  • RQ4SAR 가정 하에서 SAR-EM은 데이터로부터 진정한 유인도수 함수를 정확히 재구성할 수 있는가?
  • RQ5비균형 도메인(양성 클래스 사전확률이 편향된 경우)에서 SAR-EM은 효과적인가?

주요 결과

  • SAR-EM은 진정한 유인도수를 사용하는 SAR-e와 거의 동일한 성능을 보이며, 진정한 유인도수를 사전에 알지 못해도 레이블링 메커니즘을 효과적으로 학습함을 시사한다.
  • SCAR 가정이 위반될 경우, 이를 가정하면 성능 저하가 심각하게 발생하며, 특히 일정하지 않은 레이블링 확률에 가까워질수록 더욱 뚜렷하다.
  • SCAR 가정이 성립하지 않는 환경에서는 기존 최고 수준의 SCAR 기반 방법보다 SAR-EM이 뛰어난 성능을 보이며, 내구성을 입증한다.
  • 비균형 도메인에서는 진정한 클래스 사전확률을 안다는 점(예: SCAR-c 또는 SAR-e)이 명확한 이점이지만, SAR-EM은 이러한 지식이 없어도 강력한 성능을 달성한다.
  • SAR-EM은 분류기 F1 스코어와 유인도수 추정 모두에서 높은 정확도를 달성하며, 특히 SCAR에서 벗어난 데이터셋에서는 F1 스코어가 항상 기존 SCAR 기반 방법보다 뛰어나다.
  • SAR-EM은 다양한 데이터셋(예: Sci-Rec, Talk-Rec, Comp-Talk)에 걸쳐 강력한 일반화 능력을 보이며, 데이터 구조에 따라 F1 스코어가 0.60에서 0.80 사이로 변동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.