Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal strategies for reject option classifiers

Vojtěch Franc, Prusa, D.|arXiv (Cornell University)|2021. 01. 29.
Machine Learning and Algorithms참고 문헌 34인용 수 6
한 줄 요약

이 논문은 랜덤화된 베이즈 선택 함수를 도입하여 최적의 거부 옵션 분류기의 통합 이론적 프레임워크를 제안한다. 이는 불확실성 기반 거부를 수반하는 베이즈 최적 예측을 가능하게 한다. 연구는 적절한 불확실성 점수를 조건부 기대 위험에 의해 유도되는 순서를 유지하는 스칼라 요약으로 정의하고, 이를 바탕으로 데이터로부터 학습 가능한 두 가지 피셔-일致한 알고리즘을 제안하여 분류, 순서형 회귀, 구조적 예측 작업 전반에서 최적의 리스크-커버리지 트레이드오프를 달성한다.

ABSTRACT

In classification with a reject option, the classifier is allowed in uncertain cases to abstain from prediction. The classical cost-based model of a reject option classifier requires the cost of rejection to be defined explicitly. An alternative bounded-improvement model, avoiding the notion of the reject cost, seeks for a classifier with a guaranteed selective risk and maximal cover. We coin a symmetric definition, the bounded-coverage model, which seeks for a classifier with minimal selective risk and guaranteed coverage. We prove that despite their different formulations the three rejection models lead to the same prediction strategy: a Bayes classifier endowed with a randomized Bayes selection function. We define a notion of a proper uncertainty score as a scalar summary of prediction uncertainty sufficient to construct the randomized Bayes selection function. We propose two algorithms to learn the proper uncertainty score from examples for an arbitrary black-box classifier. We prove that both algorithms provide Fisher consistent estimates of the proper uncertainty score and we demonstrate their efficiency on different prediction problems including classification, ordinal regression and structured output classification.

연구 동기 및 목표

  • 비용 기반, 경계 개선, 경계 커버리지 모델에 대한 기존 최적 거부 옵션 분류기의 제약을 통합하고 확장하기 위해.
  • 모든 세 모델에서 최적성을 보장하는 베이즈 분류기와 랜덤화된 베이즈 선택 함수를 포함하는 최적 예측 전략을 공식적으로 특성화하기 위해.
  • 조건부 기대 위험에 의해 유도되는 순서를 유지하는 스칼라 함수로서 최적의 거부 정책을 구성하는 데에 충분한 조건을 만족하는 적절한 불확실성 점수를 정의하기 위해.
  • 어떤 블랙박스 분류기에도 적용 가능한 일반적인 두 가지 피셔-일치 알고리즘을 개발하여 적절한 불확실성 점수를 데이터로부터 학습하기 위해.
  • 이중 분류, 순서형 회귀, 구조적 출력 분류를 포함한 다양한 과제에서 제안된 방법을 실증적으로 검증하여 리스크-커버리지 성능 향상을 입증하기 위해.

제안 방법

  • 조건부 기대 위험이 임계값 근처일 경우 예측을 확률적으로 거부하는 랜덤화된 베이즈 선택 함수를 도입하며, 이는 리스크 또는 커버리지 제약 조건을 충족하도록 수용 확률을 조정한다.
  • 경계 커버리지 모델을 경계 개선 모델의 대칭 이중으로 정의하여, 보장된 커버리지 제약 조건 하에서 선택적 리스크를 최소화한다.
  • 동일한 랜덤화된 베이즈 선택 함수가 경계 개선 모델과 경계 커버리지 모델 모두를 해결할 수 있음을 입증하여, 세 가지 거부 전략(비용 기반, 경계 개선, 경계 커버리지)을 통합한다.
  • 입력의 조건부 위험에 의해 유도되는 순서를 유지하는 함수로서 최적의 거부 정책을 복원하는 데에 충분한 조건을 만족하는 적절한 불확실성 점수를 제안한다.
  • 두 가지 학습 알고리즘을 개발한다: 하나는 프록시 손실 함수를 사용한 경험적 리스크 최소화 기반이고, 다른 하나는 쌍별 비교 기반 서브티튜트를 사용하며, 둘 다 피셔-일치임을 증명한다.
  • 리스크-커버리지 트레이드오프를 근사하기 위해 로그-합-지수(log-sum-exp) 항을 포함하는 프록시 손실 함수를 활용하며, 최적 점수 수렴에 대한 이론적 보장을 제공한다.

실험 결과

연구 질문

  • RQ1기본 분포가 알려진 상태에서 경계 개선 모델 하에서 최적의 예측 전략은 무엇인가?
  • RQ2경계 개선 모델의 대칭 이중인 경계 커버리지 모델은 최적의 거부 정책과 어떻게 관련이 있는가?
  • RQ3스칼라 불확실성 점수가 최적의 랜덤화된 베이즈 선택 함수를 구성하는 데에 충분하기 위해 만족해야 하는 조건은 무엇인가?
  • RQ4일반적인 학습 알고리즘을 설계하여 데이터로부터 적절한 불확실성 점수를 추정하면서도 피셔-일치성을 보장할 수 있는가?
  • RQ5제안된 알고리즘이 다양한 학습 과제에서 기존의 불확실성 추정 방법과 비교해 리스크-커버리지 트레이드오프 측면에서 성능이 어떻게 다른가?

주요 결과

  • 비용 기반, 경계 개선, 경계 커버리지의 세 가지 거부 모델에 대한 최적 전략은 모두 동일하다: 랜덤화된 베이즈 선택 함수를 갖춘 베이즈 분류기이다.
  • 랜덤화된 베이즈 선택 함수는 결정 임계값과 수용 확률로 완전히 특성화되며, 목표 리스크 수준과 커버리지 수준과의 명시적 관계를 가진다.
  • 적절한 불확실성 점수는 조건부 기대 위험에 의해 유도되는 순서를 유지하는 함수로 정의되며, 최적의 거부 정책을 복원하는 데에 충분하다.
  • 제안된 학습 알고리즘은 피셔-일치이며, 표본 크기가 증가함에 따라 진짜 최적의 불확실성 점수로 수렴한다.
  • 실증 결과는 학습된 불확실성 점수가 분류, 순서형 회귀, 구조적 출력 예측 과제 전반에서 뛰어난 리스크-커버리지(RC) 곡선 성능을 보임을 보여준다.
  • 이론적 분석을 통해 최적 전략은 조건부 위험과 거부 파rameter에 의해 유일하게 결정되며, 이보다 더 나은 성능을 내는 다른 전략은 존재하지 않음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.