Skip to main content
QUICK REVIEW

[논문 리뷰] Learning from Positive and Unlabeled Data with Arbitrary Positive Shift

Zayd Hammoudeh, Daniel Lowd|arXiv (Cornell University)|2020. 02. 24.
Machine Learning and Algorithms참고 문헌 45인용 수 19
한 줄 요약

이 논문은 라벨이 부여된 양성 데이터가 목표 분포와 비표본적이거나 비대칭적인 경우에도 적용 가능한, 임의의 양성 이동을 고려한 새로운 양성-무라벨(PU) 학습 프레임워크를 제안한다. 두 개의 무라벨 데이터셋(소스 및 타겟 도메인에서 수집)을 활용하고 음성 클래스 분포가 고정되어 있다고 가정함으로써, 두 가지 통계적으로 일致하는 방법—PU2aPNU(양성-무라벨 및 무라벨-무라벨 학습을 조합한 이단계 방법)와 PURR(재귀적 리스크 추정기)—를 제안한다. 이는 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 양성 클래스 조건부 지원이 서로 겹치지 않는 경우에도 효과를 발휘한다.

ABSTRACT

Positive-unlabeled (PU) learning trains a binary classifier using only positive and unlabeled data. A common simplifying assumption is that the positive data is representative of the target positive class. This assumption rarely holds in practice due to temporal drift, domain shift, and/or adversarial manipulation. This paper shows that PU learning is possible even with arbitrarily non-representative positive data given unlabeled data from the source and target distributions. Our key insight is that only the negative class's distribution need be fixed. We integrate this into two statistically consistent methods to address arbitrary positive bias - one approach combines negative-unlabeled learning with unlabeled-unlabeled learning while the other uses a novel, recursive risk estimator. Experimental results demonstrate our methods' effectiveness across numerous real-world datasets and forms of positive bias, including disjoint positive class-conditional supports. Additionally, we propose a general, simplified approach to address PU risk estimation overfitting.

연구 동기 및 목표

  • 라벨이 부여된 양성 데이터가 목표 양성 분포와 임의로 비표본적이거나 비대칭적인 경우에도 PU 학습의 과제를 해결하고자 한다.
  • 시간적 드리프트, 도메인 이동 또는 악성 조작으로 인해 자주 위반되는, 라벨이 부여된 양성 데이터가 대표성을 갖는다는 강력한 가정을 완화하고자 한다.
  • 라벨이 부여된 데이터와 목표 데이터의 양성 클래스 조건부 지원이 서로 겹치지 않는 경우에도 효과적인 통계적으로 일치하는 방법을 개발하고자 한다.
  • 일반적인 PU 학습 설정에 적용 가능한 단순화된 보편적 보정 방법(abs-PU)을 통해 PU 리스크 추정에서의 과적합을 완화하고자 한다.

제안 방법

  • PU2aPNU를 제안하며, 이는 먼저 표준 PU 학습을 수행한 후, 무라벨-무라벨(UU) 학습을 통해 양성 분포 이동을 보정하는 이단계 방법이다.
  • PU2aPNU와 유사하게, 소스 및 타겟 분포 간의 관계를 재귀적으로 모델링함으로써 임의의 양성 이동 조건 하에서도 일관된 리스크 추정이 가능한 새로운 재귀적 리스크 추정기인 PURR를 도입한다.
  • PU 리스크 추정에서의 과적합을 보정하기 위해 abs-PU 방법을 활용하며, 이는 최적화를 단순화하고 일반화 성능을 향상시킨다.
  • 핵심 통찰은 음성 클래스 분포만 고정되어 있으면 되며, 양성 클래스의 이동은 임의로 허용될 수 있다는 점을 활용한다.
  • 소스와 타겟 도메인 각각에서 확보한 두 개의 무라벨 데이터셋을 사용하여 진정한 리스크를 추정하고 양성 분포 이동을 보정한다.
  • 밀도 비율 추정 및 사전 확률 조정을 활용하여 리스크 추정기의 분포 간 일치를 도모하며, 특히 사전 확률의 잘못된 추정 상황에서도 유연성을 확보한다.

실험 결과

연구 질문

  • RQ1대표성이 없는 라벨이 부여된 양성 데이터가 존재할 경우, 임의의 양성 분포 이동에 대해 강건한 PU 학습이 가능할 수 있는가?
  • RQ2라벨이 부여된 양성 분포와 목표 양성 분포의 지원이 서로 겹치지 않는 경우에도 통계적으로 일관된 리스크 추정이 가능할 수 있는가?
  • RQ3특히 복잡한 모델을 사용할 경우, PU 리스크 추정에서의 과적합을 효과적으로 완화할 수 있는가?
  • RQ4사전 확률의 잘못된 추정이 aPU 학습 방법의 성능에 미치는 영향은 무엇이며, 이를 어떻게 강건하게 만들 수 있는가?
  • RQ5제안된 방법(PU2aPNU 및 PURR)은 다양한 실제 데이터셋에서 최신 기술 수준의 PU 및 편향된 PU 학습 방법과 비교해 볼 때 어떻게 성능을 내는가?

주요 결과

  • PU2aPNU와 PURR는 MNIST, 20 Newsgroups, CIFAR10 등 다양한 실제 데이터셋에서 다양한 형태의 양성 편향 조건 하에서도 최신 기술 수준의 PU 및 bPU 학습 방법을 초월하는 성능을 달성한다.
  • 양성 클래스 조건부 지원이 서로 겹치지 않는 경우에도 강력한 성능을 발휘하여, 임의의 양성 이동 조건 하에서도 PU 학습의 가능성과 실현 가능성을 입증한다.
  • 사전 확률의 잘못된 추정 조건에서의 실험 결과, PU2aPNU는 사전 확률의 잘못된 설정에 가장 덜 민감했으며, PURR는 학습 및 테스트 시 사전 확률가 서로 반대 방향으로 잘못 설정된 경우 성능 저하가 가장 심했다. 이는 PURR의 사전 비율 의존성 때문이었다.
  • abs-PU 방법은 리스크 추정에서의 과적합을 효과적으로 감소시켜 일반화 성능을 향상시키고, 제안된 aPU 학습 프레임워크 내 최적화 과정을 단순화한다.
  • MNIST 데이터셋에서 사전 확률가 정확히 설정된 조건 하에서 PURR는 오분류율 12.9%를 기록했고, PU2aPNU는 동일한 조건에서 7.4%를 달성했다.
  • 스팸 이메일 데이터셋을 활용한 악성 aPU 학습 실험에서, 제안된 방법들은 기존 벤치마크를 크게 앞서며, 동적인 실제 환경에서의 강건성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.