Skip to main content
QUICK REVIEW

[논문 리뷰] Taking a hint: How to leverage loss predictors in contextual bandits?

Chen-Yu Wei, Haipeng Luo|arXiv (Cornell University)|2020. 03. 04.
Advanced Bandit Algorithms Research참고 문헌 29인용 수 5
한 줄 요약

이 논문은 손실 예측기와 함께 문맥적 밴디트를 연구하며, 총 예측 오차 𝔈 이 작을 경우, 리그레트가 크게 감소할 수 있음을 보여준다. 예측기의 특성을 활용하는 새로운 알고리즘을 제안하여, 알려진 𝔈 인 경우 최적의 리그레트 한계 𝒪(√𝔼𝑇¹/⁴) 와 미지의 𝔈 인 경우 𝒪(√𝔼𝑇¹/³) 를 달성하며, 비문맥적 설정과 달리 다수의 예측기 사용 시 M에 대해 선형 의존성이 발생함을 밝혀낸다.

ABSTRACT

We initiate the study of learning in contextual bandits with the help of loss predictors. The main question we address is whether one can improve over the minimax regret $\mathcal{O}(\sqrt{T})$ for learning over $T$ rounds, when the total error of the predictor $\mathcal{E} \leq T$ is relatively small. We provide a complete answer to this question, including upper and lower bounds for various settings: adversarial versus stochastic environments, known versus unknown $\mathcal{E}$, and single versus multiple predictors. We show several surprising results, such as 1) the optimal regret is $\mathcal{O}(\min\{\sqrt{T}, \sqrt{\mathcal{E}}T^\frac{1}{4}\})$ when $\mathcal{E}$ is known, a sharp contrast to the standard and better bound $\mathcal{O}(\sqrt{\mathcal{E}})$ for non-contextual problems (such as multi-armed bandits); 2) the same bound cannot be achieved if $\mathcal{E}$ is unknown, but as a remedy, $\mathcal{O}(\sqrt{\mathcal{E}}T^\frac{1}{3})$ is achievable; 3) with $M$ predictors, a linear dependence on $M$ is necessary, even if logarithmic dependence is possible for non-contextual problems. We also develop several novel algorithmic techniques to achieve matching upper bounds, including 1) a key action remapping technique for optimal regret with known $\mathcal{E}$, 2) implementing Catoni's robust mean estimator efficiently via an ERM oracle leading to an efficient algorithm in the stochastic setting with optimal regret, 3) constructing an underestimator for $\mathcal{E}$ via estimating the histogram with bins of exponentially increasing size for the stochastic setting with unknown $\mathcal{E}$, and 4) a self-referential scheme for learning with multiple predictors, all of which might be of independent interest.

연구 동기 및 목표

  • 손실 예측기가 표준 𝒪(√T) 최소최대 경계를 초월하여 문맥적 밴디트에서 리그레트를 향상시킬 수 있는지 조사하기.
  • 총 예측 오차 𝔈 이 알려져 있거나 알려지지 않았을 경우 최적의 리그레트 한계를 결정하기.
  • 다수의 예측기가 리그레트에 미치는 영향, 특히 예측기 수 M 에 대한 의존성 분석하기.
  • 공격적 환경과 확률적 환경 모두에서 이러한 향상된 리그레트 한계를 달성하는 효율적인 알고리즘 개발하기.
  • 문맥적 밴디트와 비문맥적 문제(예: 다항 보상 밴디트) 간에 손실 예측기를 활용할 때의 근본적인 차이 이해하기.

제안 방법

  • 알려진 𝔈 인 경우 최적의 리그레트를 달성하기 위해 새로운 액션 재매핑 기법을 도입하여 예측 품질을 보다 효과적으로 활용한다.
  • 확률적 환경에서 Catoni의 강력한 평균 추정기의 계산 효율적인 구현을 ERM 오라클을 통해 구현하여 최적의 리그레트를 달성한다.
  • 확률적 환경에서 미지의 𝔈 을 고려하기 위해 지수 증가하는 박스 크기를 갖는 히스토그램 추정을 사용한 𝔈 의 저평가기법을 제안한다.
  • 다수의 예측기에서의 학습을 위해 자기참조적 구조를 개발하여 M개의 소스에서 온 예측을 적응적으로 통합한다.
  • 예측 신뢰도에 따라 탐색을 동적으로 조정하는 예산 기반 메커니즘을 도입하여 예측 정확도와 강건성 사이의 균형을 이룬다.
  • 공격적 및 i.i.d. 환경 모두에서 리그레트를 유한하게 제한하기 위해 예측 오차와 신뢰구간의 계층적 분석을 수행한다.

실험 결과

연구 질문

  • RQ1손실 예측기는 표준 𝒪(√T) 최소최대 경계를 초월하여 문맥적 밴디트에서 리그레트를 감소시킬 수 있는가?
  • RQ2총 예측 오차 𝔈 이 알려져 있을 경우 최적의 리그레트 한계는 무엇이며, 비문맥적 설정과 비교해 볼 때 어떻게 다른가?
  • RQ3𝔼 가 알려지지 않았을 경우 리그레트 한계는 어떻게 되며, 여전히 비선형 리그레트를 달성할 수 있는가?
  • RQ4예측기 수 M 이 리그레트에 미치는 영향은 무엇이며, 문맥적 밴디트에서 M 에 대해 로그 의존성이 가능할까?
  • RQ5최소한의 계산 오버헤드로 최적의 리그레트를 달성하는 효율적인 알고리즘을 설계할 수 있는가?

주요 결과

  • 알려진 𝔈 인 경우 최적의 리그레트는 𝒪(min{√T, √𝔼𝑇¹/⁴}) 이며, 이는 다항 보상 밴디트와 같은 비문맥적 문제에서의 𝒪(√𝔼) 경계보다 엄격히 열 劣하다.
  • 𝔼 가 알려지지 않았을 경우 𝒪(√𝔼𝑇¹/⁴) 경계는 달성 불가능하며, 오히려 달성 가능한 최선의 리그레트는 𝒪(√𝔼𝑇¹/³) 이며, 𝔈 = o(T¹/³) 이면 여전히 비선형이다.
  • M개의 예측기가 있는 경우 알려진 𝔈* 인 경우 최적의 리그레트는 𝒪(√(M𝔼*)𝑇¹/⁴) 이며, 이는 비문맥적 설정에서 가능했던 로그 의존성과는 달리 M에 대해 선형 의존성을 보인다.
  • 알려지지 않은 𝔈* 인 경우 최적의 리그레트는 𝒪(M²/³(𝔼*T)¹/³) 이며, 예측기 수와 예측 오차 사이의 비트리비알한 트레이드오프를 보여준다.
  • 제안된 알고리즘은 모든 설정에서 일치하는 상한선을 달성하며, 액션 재매핑과 𝔈 의 강력한 히스토그램 기반 저평가 기법과 같은 새로운 기법을 도입한다.
  • 결과적으로 정보 이론적으로 최적임을 증명하는 날카로운 하한선을 확립하여, 유도된 리그레트 경계가 주어진 가정 하에 정보 이론적으로 최적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.