Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Gamblers: Learning to Abstain with Portfolio Theory

Liu Ziyin, Zhikang Wang|arXiv (Cornell University)|2019. 06. 29.
Financial Markets and Investment Strategies참고 문헌 61인용 수 33
한 줄 요약

논문은 선택적 분류를 도박 문제로 재구성하고, 포트폴리오 이론을 활용해 거절 abstention을 엔드-투-엔드로 학습하며, SVHN, CIFAR-10, Cat-vs-Dog에서 거절 메커니즘으로 경쟁력 있는 결과를 달성한다.

ABSTRACT

We deal with the extit{selective classification} problem (supervised-learning problem with a rejection option), where we want to achieve the best performance at a certain level of coverage of the data. We transform the original $m$-class classification problem to $(m+1)$-class where the $(m+1)$-th class represents the model abstaining from making a prediction due to disconfidence. Inspired by portfolio theory, we propose a loss function for the selective classification problem based on the doubling rate of gambling. Minimizing this loss function corresponds naturally to maximizing the return of a extit{horse race}, where a player aims to balance between betting on an outcome (making a prediction) when confident and reserving one's winnings (abstaining) when not confident. This loss function allows us to train neural networks and characterize the disconfidence of prediction in an end-to-end fashion. In comparison with previous methods, our method requires almost no modification to the model inference algorithm or model architecture. Experiments show that our method can identify uncertainty in data points, and achieves strong results on SVHN and CIFAR10 at various coverages of the data.

연구 동기 및 목표

  • 정확도와 데이터 커버리지를 균형 있게 맞추기 위한 거절 옵션이 있는 선택적 분류 문제를 다룬다.
  • 추가 abstain 옵션으로 m개의 클래스를 m+1 클래스로 변환한다.
  • 불확실할 때 abstention을 촉진하는 포트폴리오 이론의 이중 증가율(doubling rate)에 기반한 손실을 도입한다.
  • 표준 아키텍처 및 추론에 최소한의 수정으로 엔드-투-엔드 학습을 가능하게 한다.
  • 분류를 도박과 연결하는 이론적 통찰을 제시하고 abstention 전략의 조건을 정량화한다.

제안 방법

  • 분류를 abstention을 포함한 (m+1) 카테고리의 경마로 재구성한다.
  • 손실은 배율 증가율 W(b,p) = sum_i p_i log2(b_i o_i + b_{m+1}) 로 정의되며, 미니배치에서 o를 payoff 파라미터로 두어야 한다.
  • (m+1)번째 클래스를 abstention 결정으로 해석하고, g(x) = f_w(x)_{m+1}에 대한 임계값 h를 통해 커버리지를 조정 가능하게 한다.
  • 포트폴리오 이론과 학습을 연결하여 이중 증가율을 최대화하는 것이 abstention 제약하에 예측 가능도를 최대화하는 것임을 보인다.
  • 도박(gambling) 구성과 payoff 파라미터 o가 최적 전략에 미치는 영향을 정당화하기 위한 이론적 결과(정리 1-3)를 제공한다.
  • 합성 및 실제 데이터 실험으로 접근법을 시연하고 엔트로피, Bayes dropout, SelectiveNet과 비교한다.

실험 결과

연구 질문

  • RQ1거절이 포트폴리오 이론과 연결된 손실을 통해 학습될 수 있는가?
  • RQ2최적의 배팅(예측) 전략과 거절 행동에 영향을 주는 abstention payoff 파라미터 o 는 어떻게 설정되어야 하는가?
  • RQ3샘플링이나 아키텍처 변경 없이 선택적 분류를 위한 엔드-투-엔드 학습이 가능한가?
  • RQ4제안된 방법이 데이터셋과 커버리지 수준에서 최첨단 선택적 분류 방법과 비교하여 어떤 성능을 보이는가?

주요 결과

  • 방법은 커버리지 전반에서 SVHN에서 경쟁적이고 종종 최첨단 성능을 달성하며, 커버리지별로 최상의 결과를 제공한다.
  • 특히 0.8–1.0 커버리지 범위에서 CIFAR-10 및 Cat-vs-Dog 데이터셋에서 강력한 결과를 보인다.
  • 이 방법은 불확실성을 효과적으로 식별하여, 어려운 예시나 out-of-distribution 예시를 식별하는 데 있어 엔트로피 기반 기준선보다 우수하다.
  • 손실은 엔드 투 엔드로 학습 가능하며, 서로 다른 커버리지 수준에 대해 샘플링이나 재학습이 필요 없고, 아키텍처 변경도 요구하지 않는다.
  • t-SNE 분석은 학습된 표현이 deep gambler 손실 하에서 더 나은 클래스 분리를 보임을 시사하며, 학습된 특징 공간이 질적으로 다른 것을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.