Skip to main content
QUICK REVIEW

[논문 리뷰] Bandit Algorithms for Prophet Inequality and Pandora's Box

Khashayar Gatmiry, Thomas Keßelheim|arXiv (Cornell University)|2022. 11. 16.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 보상이 선택된 행동에 대해서만 관찰 가능한 제한된 피드백 환경에서 프로페트 예측 문제와 판도라 상자 문제에 대한 밴딧 알고리즘을 제안한다. 최적 정책 인덱스에 대한 신뢰구간을 유지하고, 새로운 탐색-이용 균형 기반 메커니즘을 통해 학습 가능한 위험 상한을 설계하여, $\widetilde{O}(\mathsf{poly}(n)\sqrt{T})$ 수준의 거의 최적의 위험 한계를 달성한다.

ABSTRACT

The Prophet Inequality and Pandora's Box problems are fundamental stochastic problem with applications in Mechanism Design, Online Algorithms, Stochastic Optimization, Optimal Stopping, and Operations Research. A usual assumption in these works is that the probability distributions of the $n$ underlying random variables are given as input to the algorithm. Since in practice these distributions need to be learned, we initiate the study of such stochastic problems in the Multi-Armed Bandits model. In the Multi-Armed Bandits model we interact with $n$ unknown distributions over $T$ rounds: in round $t$ we play a policy $x^{(t)}$ and receive a partial (bandit) feedback on the performance of $x^{(t)}$. The goal is to minimize the regret, which is the difference over $T$ rounds in the total value of the optimal algorithm that knows the distributions vs. the total value of our algorithm that learns the distributions from the partial feedback. Our main results give near-optimal $ ilde{O}(\mathsf{poly}(n)\sqrt{T})$ total regret algorithms for both Prophet Inequality and Pandora's Box. Our proofs proceed by maintaining confidence intervals on the unknown indices of the optimal policy. The exploration-exploitation tradeoff prevents us from directly refining these confidence intervals, so the main technique is to design a regret upper bound that is learnable while playing low-regret Bandit policies.

연구 동기 및 목표

  • 기본 분포가 알려져 있지 않고 제한된 피드백으로부터 학습이 필요로 하는 온라인 스토케스틱 최적화 분야의 격차를 보완하기 위해.
  • 다중 암반 밴딧 프레임워크에서 보상 피드백만 제공되는 조건 하에서 프로페트 예측 문제와 판도라의 상자 문제를 연구하기 위해.
  • 제한된 피드백 조건에서도 최적의 정책과의 차이를 최소화하면서 거의 최적의 위험을 달성하는 알고리즘을 설계하기 위해.
  • 악성 입력에 대해 서브선형 위험은 불가능함을 보여주는 이론적 하한을 설정하기 위해.
  • 최소한의 피드백으로도 저위험 성능을 달성할 수 있도록 다양한 피드백 모델 간의 온라인 학습을 통합하기 위해.

제안 방법

  • 탐색을 이끌기 위해 최적 정책의 미지 인덱스에 대한 신뢰구간을 유지하기 위해.
  • 낮은 위험 밴딧 정책을 시행하면서도 학습 가능한 위험 상한 함수를 설계하기 위해.
  • 프로페트 예측 문제와 판도라의 상자 설정 모두에서 최적 임계값 추정치를 정교화하기 위해 간격 수축 알고리즘을 사용하기 위해.
  • 적응적 탐색을 통해 라운드 전반에 걸쳐 저위험 성능을 보장하기 위해 듀얼링 프레임워크를 적용하기 위해.
  • 고정 또는 동적 순서에서 판도라의 상자 문제에서 정책 이탈을 제한하기 위해 이동 차이와 교환 차이 분석을 도입하기 위해.
  • 반복적인 제약 조건 및 신뢰구간 정밀화를 통해 학습된 정책을 다항 시간 내에 최적 정책으로 변환하기 위해.

실험 결과

연구 질문

  • RQ1보상 피드백(단지 보상만)이 제공되는 조건에서 프로페트 예측 문제에서 거의 최적의 위험을 달성할 수 있는가?
  • RQ2알 수 없는 분포 조건 하에서 밴딧 피드백을 받는 판도라의 상자 문제로 동일한 위험 한계를 확장할 수 있는가?
  • RQ3제한된 피드백 조건 하에서 악성 입력 시퀀스에 대해 이러한 문제들의 위험의 본질적 한계는 무엇인가?
  • RQ4밴딧 피드백 조건 하에서 탐색-이용 균형의 고려 사항이 있는 상태에서 최적 정책 인덱스에 대한 신뢰구간을 어떻게 유지하고 정교화할 수 있는가?
  • RQ5피드백 요구량을 최소화하면서도 다양한 피드백 모델에서 거의 최적의 성능을 달성할 수 있는 단일 알고리즘이 존재하는가?

주요 결과

  • 논문은 밴딧 피드백 조건 하에서 프로페트 예측 문제와 판도라의 상자 문제 양자 모두에 대해 총 위험 $\widetilde{O}(\mathsf{poly}(n)\sqrt{T})$ 를 달성한다.
  • 프로페트 예측 문제에서 $n=2$ 인 경우, 알고리즘은 최적의 임계값에 대한 신뢰를 유지하기 위해 간격 수축 접근법을 사용하여 $\widetilde{O}(\sqrt{T})$ 위험을 달성한다.
  • 판도라의 상자 문제에서는 동적 제약 조건 업데이트를 통해 이동 차이와 교환 차이를 모두 제한함으로써 효율적인 정책 변환을 가능하게 한다.
  • 스토케스틱 입력에 대해 $\Omega(\sqrt{T})$ 의 하한이 확립되어, 위험 한계가 로그 인자 수준까지 정확함을 보여준다.
  • 악성 입력에 대해서는 $\Omega(T)$ 위험은 피할 수 없음을 증명하였으며, 이는 전체 피드백 조건 하에서도 서브선형 위험은 불가능함을 의미한다.
  • 결과적으로, 악성 입력 하에서 판도라의 상자 문제에 대한 온라인 학습에서 서브선형 위험의 열린 질문을 해결하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.