[논문 리뷰] Contextual Blocking Bandits
이 논문은 보상이 확률적 맥락에 따라 달라지고, 사용 후 고정된 기간 동안 차단되는 암시적 블로킹 밴딧이라는 새로운 다중 손잡이 밴딧 프레임워크를 소개한다. 지연된 이용과 기회적 부분 표본 추출을 통한 UCB 기반 알고리즘을 제안하여, α-최적 정책에 대해 $Ø(\log T)$의 리그레트를 달성하며, 이는 정보 이론적 하한선과 일치한다.
We study a novel variant of the multi-armed bandit problem, where at each time step, the player observes an independently sampled context that determines the arms' mean rewards. However, playing an arm blocks it (across all contexts) for a fixed and known number of future time steps. The above contextual setting, which captures important scenarios such as recommendation systems or ad placement with diverse users, invalidates greedy solution techniques that are effective for its non-contextual counterpart (Basu et al., NeurIPS19). Assuming knowledge of the context distribution and the mean reward of each arm-context pair, we cast the problem as an online bipartite matching problem, where the right-vertices (contexts) arrive stochastically and the left-vertices (arms) are blocked for a finite number of rounds each time they are matched. This problem has been recently studied in the full-information case, where competitive ratio bounds have been derived. We focus on the bandit setting, where the reward distributions are initially unknown; we propose a UCB-based variant of the full-information algorithm that guarantees a $\mathcal{O}(\log T)$-regret w.r.t. an $α$-optimal strategy in $T$ time steps, matching the $Ω(\log(T))$ regret lower bound in this setting. Due to the time correlations caused by blocking, existing techniques for upper bounding regret fail. For proving our regret bounds, we introduce the novel concepts of delayed exploitation and opportunistic subsampling and combine them with ideas from combinatorial bandits and non-stationary Markov chains coupling.
연구 동기 및 목표
- 추천 시스템이나 릭셰어 플랫폼과 같은 실세계 자원 할당 문제를 모델링하기 위해 보상이 맥락에 따라 달라지고, 사용 후 일시적으로 차단되는 암시적 블로킹 밴딧을 고려한다.
- 시간적 의존성으로 인해 표준 UCB 및 LP 기반 방법이 실패하는 블로킹이 있는 밴딧 설정에서 알려지지 않은 보상 분포를 학습하는 도전 과제를 해결한다.
- 블로킹으로 인한 시간에 따라 상관관계를 가진 결정들에도 불구하고 최적의 리그레트 성능을 달성하는 밴딧 알고리즘을 개발한다.
- 알려진 맥락 분포와 평균 보상 조건 하에서, 이 설정에서 $\Omega(\log T)$ 하한선과 일치하는 이론적 리그레트 하한을 확립한다.
제안 방법
- 현재 암시의 가용성과 분리하기 위해 지연된 시간 창 $t - M_t$에서의 UCB 추정치를 사용하는 시간 무관 밴딧 알고리즘을 제안하며, 여기서 $M_t = \Theta(\log t)$이다.
- 지연된 이용 개념을 도입하여 지연 창 내의 기본 마르코프 체인이 혼합되도록 하여, UCB 추정치와 블로킹 동역학 간의 상관관계를 제거한다.
- 블로킹 하에서 열악한 암시의 충분한 표본 추출을 유지하기 위해 기회적 부분 표본 추출 기법을 활용하여 LP 해의 수렴을 가능하게 한다.
- 조합적 밴딧과 비정상 마르코프 체인 결합 기법을 결합하여, 시간에 따라 상관관계를 가진 결정들에도 불구하고 리그레트를 근사한다.
- 시간에 따라 변하는 스킵 확률을 갖는 랜덤화된 LP 라운딩 전략을 제안하며, UCB 기반 신뢰 구간을 통해 온라인으로 적응한다.
- 리그레트 하한을 $\mathcal{O}\left(\frac{km(k+m)\log T}{\Delta}\right)$로 유도하며, 여기서 $k$는 암시의 수, $m$은 맥락의 수, $\Delta$는 최적의 비최적 LP 해와의 격차이다.
실험 결과
연구 질문
- RQ1암시 가용성이 시간에 따라 상관관계를 가지는 맥락 기반 블로킹 밴딧 설정에서 밴딧 알고리즘이 $\mathcal{O}(\log T)$ 리그레트를 달성할 수 있는가?
- RQ2비정상 환경에서 지연된 이용은 어떻게 UCB 추정치와 블로킹 동역학 간의 상관관계를 제거하는 데 활용될 수 있는가?
- RQ3어떤 표본 추출 전략이 블로킹 제약 하에서 열악한 암시의 충분한 탐색을 보장하여 LP 기반 결론의 수렴을 가능하게 하는가?
- RQ4블로킹으로 인한 상관관계로 인해 표준 밴딧 기법이 실패하는 상황에서도 이 설정에서 $\Omega(\log T)$ 하한선과 일치하는 리그레트를 달성할 수 있는가?
- RQ5완전 정보 설정에서 온라인 정책의 최적 경쟁 비율은 클레어보이언트 정책에 대해 얼마이며, 이는 최대 블로킹 지연에 어떻게 의존하는가?
주요 결과
- 제안된 알고리즘은 $\mathcal{O}\left(\frac{km(k+m)\log T}{\Delta}\right)$ 리그레트를 달성하며, 이는 $\Omega(\log T)$ 하한선과 일치하여 밴딧 설정에서의 최적성을 입증한다.
- 지연된 이용—$t - \Theta(\log t)$에서의 UCB 값 사용—은 시스템의 마르코프 체인이 혼합되도록 하여, UCB 추정치와 암시 가용성 간의 상관관계를 제거한다.
- 기회적 부분 표본 추출 기법은 블로킹 하에서 열악한 암시의 충분한 표본 추출을 보장하며, 시간이 지남에 따라 LP 해의 수렴을 지원한다.
- 완전 정보 설정의 경우, 경쟁 비율의 하한은 $\frac{d_{\text{max}}}{2d_{\text{max}} - 1}$로 유도되며, 이는 클레어보이언트 블록 기반 정책과 극한 분석을 통해 도출된다.
- 알고리즘이 온라인으로 UCB를 통해 알려지지 않은 보상 분포를 학습함에 따라, 리그레트 하한은 알려진 맥락 분포와 암시-맥락 쌍 당 평균 보상 조건 하에서 유지된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.