Skip to main content
QUICK REVIEW

[논문 리뷰] Distribution oblivious, risk-aware algorithms for multi-armed bandits with unbounded rewards

Anmol Kagrecha, Jayakrishnan Nair|arXiv (Cornell University)|2019. 06. 01.
Advanced Bandit Algorithms Research인용 수 16
한 줄 요약

이 논문은 보상 분포에 대한 사전 지식이 없이도, 기대 보상과 조건부가치의 기대값(CVaR) 간의 트레이드오프를 최적화하는 분포 무관(risk-aware) 알고리즘을 제안한다. 이는 보상이 유계가 아니며, 분포의 모멘트나 초과 갭에 대한 사전 지식 없이도 증명 가능한 오차 한계를 확보한다. 특히, 무거운 尾를 가진 분포에 대해 새로운 CVaR 추정기와 농도 불확실성 부등식을 제안한다.

ABSTRACT

Classical multi-armed bandit problems use the expected value of an arm as a metric to evaluate its goodness. However, the expected value is a risk-neutral metric. In many applications like finance, one is interested in balancing the expected return of an arm (or portfolio) with the risk associated with that return. In this paper, we consider the problem of selecting the arm that optimizes a linear combination of the expected reward and the associated Conditional Value at Risk (CVaR) in a fixed budget best-arm identification framework. We allow the reward distributions to be unbounded or even heavy-tailed. For this problem, our goal is to devise algorithms that are entirely distribution oblivious, i.e., the algorithm is not aware of any information on the reward distributions, including bounds on the moments/tails, or the suboptimality gaps across arms. In this paper, we provide a class of such algorithms with provable upper bounds on the probability of incorrect identification. In the process, we develop a novel estimator for the CVaR of unbounded (including heavy-tailed) random variables and prove a concentration inequality for the same, which could be of independent interest. We also compare the error bounds for our distribution oblivious algorithms with those corresponding to standard non-oblivious algorithms. Finally, numerical experiments reveal that our algorithms perform competitively when compared with non-oblivious algorithms, suggesting that distribution obliviousness can be realised in practice without incurring a significant loss of performance.

연구 동기 및 목표

  • 위험 관리가 중요한 응용 분야에서 위험 중립적인 기대값 기준에 의존하는 전통적인 다수의 암실 밴딧 알고리즘의 한계를 해결하기 위해.
  • 보상 분포의 모멘트, 尾 행동, 초과 갭에 대한 사전 지식이 전혀 필요 없이도 강력한 성능 보장을 확보하는 알고리즘을 개발하기 위해.
  • 고정 예산(best-arm identification) 프레임워크 내에서 기대 보상과 조건부가치의 기대값(CVaR)의 선형 조합을 최적화하기 위해.
  • 보상 분포가 유계이거나 무거운 尾를 가질 수 있는 상황에서 잘못된 암실 식별 확률에 대한 증명 가능한 상한을 설정하기 위해.

제안 방법

  • 보상 분포에 대한 가정 없이도, 분포의 모멘트나 尾 행동에 대한 지식 없이도 위험 인식 가능한 의사결정을 가능하게 하는, 무한대 또는 무거운 尾를 가진 랜덤 변수에 대한 새로운 CVaR 추정기를 설계한다.
  • 제안된 CVaR 추정기의 농도 불확실성 부등식을 증명하며, 이는 유한 샘플 성능 보장을 유도하는 데 필수적이다.
  • 보상 분포의 정보를 전혀 사용하지 않고도, 추정된 CVaR와 기대 보상에 기반해 탐색과 이용을 균형 잡는 분포 무관 알고리즘의 클래스를 구성한다.
  • 고정 예산 프레임워크를 사용하여, 보상 분포가 알려져 있지 않거나 무거운 尾를 가질 수 있는 상황에서라도 알고리즘이 높은 확률로 최적의 암실을 선택하도록 보장한다.
  • 위험 조정된 성능 추정에 기반해 암실에 대한 추출 횟수를 동적으로 할당하는, CVaR 추정기를 다수의 암실 학습 프레임워크에 통합한다.
  • 분포의 특성에 따라 달라지지 않는 문제의 본질적 어려움에만 의존하는 잘못된 식별 확률에 대한 이론적 상한을 유도한다.

실험 결과

연구 질문

  • RQ1보상 분포가 유계가 아니며, 분포의 모멘트나 尾 행동에 대한 지식이 전혀 없을 때, 기대 보상과 CVaR를 효과적으로 균형 잡는 분포 무관 알고리즘을 설계할 수 있는가?
  • RQ2보상 분포가 유계이거나 무거운 尾를 가지며, 분포에 대한 정보가 전혀 없을 때, CVaR에 대한 강력하고 증명 가능한 정확한 추정기는 무엇인가?
  • RQ3모멘트나 尾 행동에 대한 지식을 사용하는 비-무관 알고리즘과 비교해, 분포 무관 알고리즘의 오차 한계는 어떻게 되는가?
  • RQ4분포에 대한 가정이 없는 상황에서도 실용적으로 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5일반적인 유계가 아닌 분포 하에서 제안된 CVaR 추정기의 농도 성질은 어떠한가?

주요 결과

  • 제안된 CVaR 추정기는 분포의 모멘트나 尾 감쇠 비율에 대한 지식 없이도, 무한대 또는 무거운 尾를 가진 분포에 대해 증명 가능한 농도 상한을 제공하는 최초의 추정기이다.
  • 논문은 보상 분포에 대한 가정이 존재하는 것 외에는 제한이 없고, 첫 번째 모멘트가 존재하는 것만 요구하는 잘못된 식별 확률에 대한 이론적 상한을 확립한다.
  • 수치 실험 결과, 비-무관 알고리즘과 비교해도 분포 무관 알고리즘이 경쟁 가능한 성능을 보이며, 분포 무지가 성능에 심각한 손실을 끼치지 않음을 시사한다.
  • CVaR 추정기의 농도 부등식은 별도의 관심사이며, 밴딧 설정 외부 응용에도 적용 가능할 수 있다.
  • 제안된 알고리즘의 오차 한계는 비-무관 알고리즘과 비슷한 주기의 크기를 가지며, 분포 무관성은 이론적 보장을 포기하지 않고도 실현 가능하다는 것을 보여준다.
  • 이 프레임워크는 보상 분포에 대한 지식이 없이도 위험 인식(CVaR 기반)을 최적의 암실 식별 문제에 통합함으로써, 밴딧 문헌에서 새로운 기여를 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.