Skip to main content
QUICK REVIEW

[논문 리뷰] Binary Classification with Bounded Abstention Rate

Shubhanshu Shekhar, Mohammad Ghavamzadeh|arXiv (Cornell University)|2019. 05. 23.
Machine Learning and Algorithms참고 문헌 22인용 수 5
한 줄 요약

이 논문은 데이터 기반의 적응형 접근을 통해 고정된 기각 비율을 보장하는 이진 분류를 위한 새로운 플러그인 분류기 모델을 제안한다. 연속성 가정 없이 베이즈 최적 분류기를 유도하고, 부드러움과 마진 조건 하에서 초과 위험의 상한을 도출하며, 최소화 근접 최적성 보장을 갖는 계산적으로 효율적인 볼록 손실 기반 알고리즘을 제안한다. 이는 UCI 데이터셋에서 실증적으로 검증되었다.

ABSTRACT

We consider the problem of binary classification with abstention in the relatively less studied \emph{bounded-rate} setting. We begin by obtaining a characterization of the Bayes optimal classifier for an arbitrary input-label distribution $P_{XY}$. Our result generalizes and provides an alternative proof for the result first obtained by \cite{chow1957optimum}, and then re-derived by \citet{denis2015consistency}, under a continuity assumption on $P_{XY}$. We then propose a plug-in classifier that employs unlabeled samples to decide the region of abstention and derive an upper-bound on the excess risk of our classifier under standard \emph{Hölder smoothness} and \emph{margin} assumptions. Unlike the plug-in rule of \citet{denis2015consistency}, our constructed classifier satisfies the abstention constraint with high probability and can also deal with discontinuities in the empirical cdf. We also derive lower-bounds that demonstrate the minimax near-optimality of our proposed algorithm. To address the excessive complexity of the plug-in classifier in high dimensions, we propose a computationally efficient algorithm that builds upon prior work on convex loss surrogates, and obtain bounds on its excess risk in the \emph{realizable} case. We empirically compare the performance of the proposed algorithm with a baseline on a number of UCI benchmark datasets.

연구 동기 및 목표

  • 임의의 입력-라벨 분포 하에서 연속성 가정 없이 기각 비율이 제한된 이진 분류의 베이즈 최적 분류기를 특성화하는 것.
  • 비밀번호 없는 샘플을 사용하여 기각 비율 제약을 고확률로 충족시키는 플러그인 분류기를 설계하고, 경험적 분포함수의 불연속성을 다루는 것.
  • 표준 헬더 부드러움과 마진 조건 하에서 초과 위험의 상한을 도출하고, 하한을 통해 최소화 근접 최적성을 입증하는 것.
  • 고차원 설정에서 계산적으로 효율적인 볼록 손실 대체함수 기반 알고리즘을 개발하고, 실현 가능 케이스에서 이론적 초과 위험 상한을 확보하는 것.
  • 다양한 UCI 벤치마크 데이터셋에서 기준 대비 제안된 방법의 성능을 실증적으로 평가하여 기각 비율이 다양할 때에도 성능을 입증하는 것.

제안 방법

  • 연속성 가정을 완화한 새로운 증명을 통해 차우(1957)의 임계값 기반 규칙을 일반화하여 기각 비율이 제한된 경우의 베이즈 최적 분류기를 도출한다.
  • 비밀번호 샘플을 사용하여 기각 영역을 추정하고, 고확률로 기각 비율 제약을 충족시키기 위해 랜덤화된 규칙을 적용하는 플러그인 분류기를 구성한다.
  • 헬더 부드러움과 마진 조건 하에서 초과 위험의 상한을 도출하며, 알려지지 않은 부드러움 파rameter에 대한 局소 적응성을 활용한다.
  • 고차원에서의 계산 복잡도를 줄이기 위해 일반화 헬름지 손실을 사용하는 볼록 손실 기반 알고리즘을 제안하고, 실현 가능 케이스에서 이론적 초과 위험 상한을 확보한다.
  • 라데마처 복잡도와 일반화 상한을 사용하여 기각 비율을 제어하고, 고확률 제약 충족을 보장하기 위해 슬랙 항을 도입한다.
  • 랜덤화된 임계값 규칙과 잘라내기 헬름지 손실을 활용하여 유한 표본에서의 기각 비율에 대한 강건성과 엄격한 제어를 확보한다.

실험 결과

연구 질문

  • RQ1임의의 입력-라벨 분포 하에서 기각 비율이 제한된 이진 분류의 베이즈 최적 분류기는 어떤 형태를 갖는가?
  • RQ2경험적 분포함수가 불연속적일 경우에도 고확률로 기각 비율 제약을 충족시키는 플러그인 분류기는 어떻게 구성할 수 있는가?
  • RQ3표준 부드러움과 마진 조건 하에서 이러한 분류기의 초과 위험 상한은 어떤 식으로 도출할 수 있는가?
  • RQ4제안된 알고리즘이 초과 위험 측면에서 최소화 근접 최적이기는 한가?
  • RQ5고차원 설정에서 이론적 초과 위험 보장을 유지하면서 계산적으로 효율적인 볼록 손실 기반 알고리즘을 설계할 수 있는가?

주요 결과

  • 공통 분포에 대한 연속성 가정 없이도 베이즈 최적 분류기를 특성화하였으며, 차우(1957)와 데니스 및 헤비리(2015)의 이전 결과를 일반화한다.
  • 제안된 플러그인 분류기는 경험적 분포함수의 불연속성 존재하더라도 고확률로 기각 비율 제약을 충족시키며, 이는 이전 방법과의 차별성을 보인다.
  • 헬더 부드러움과 마진 조건 하에서 초과 위험 상한을 도출하였으며, 알려지지 않은 부드러움 파rameter에 대한 적응성을 입증한다.
  • 초과 위험 측면에서 제안된 알고리즘이 최소화 근접 최적이라는 것을 입증하는 하한을 확립한다.
  • 볼록 손실 대체함수를 기반으로 한 계산적으로 효율적인 알고리즘을 제안하였으며, 실현 가능 케이스에서 이론적 초과 위험 상한을 확보한다.
  • UCI 데이터셋에서의 실증 평가 결과, 제안된 알고리즘이 다양한 기각 비율에서 기준 대비 정확도-기각 트레이드오프 측면에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.