Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual Combinatorial Bandits with Probabilistically Triggered Arms

Xutong Liu, Jinhang Zuo|arXiv (Cornell University)|2023. 03. 30.
Advanced Bandit Algorithms ResearchDecision Sciences인용 수 3
한 줄 요약

이 논문은 확률적으로 촉발되는 암호를 가진 문맥적 조합 밴딧(C²MAB-T)을 소개하며, 부드러움 조건 하에서 손실 최소화를 위한 C²-UCB-T 및 VAC²-UCB 알고리즘을 제안한다. 촉발 확률 조절 조건(TPM) 하에서 $\tilde{O}(d\sqrt{KT})$의 손실 경계를 달성하고, 분산 조절(VM) 또는 TPM 및 분산 조절(TPVM) 조건 하에서는 $\tilde{O}(d\sqrt{T})$의 개선된 경계를 얻으며, $K$와 $1/p_{\min}$에 대한 의존성을 제거한다. 또한 합성 및 실세계 데이터를 통한 실험적 검증을 수행한다.

ABSTRACT

We study contextual combinatorial bandits with probabilistically triggered arms (C$^2$MAB-T) under a variety of smoothness conditions that capture a wide range of applications, such as contextual cascading bandits and contextual influence maximization bandits. Under the triggering probability modulated (TPM) condition, we devise the C$^2$-UCB-T algorithm and propose a novel analysis that achieves an $ ilde{O}(d\sqrt{KT})$ regret bound, removing a potentially exponentially large factor $O(1/p_{\min})$, where $d$ is the dimension of contexts, $p_{\min}$ is the minimum positive probability that any arm can be triggered, and batch-size $K$ is the maximum number of arms that can be triggered per round. Under the variance modulated (VM) or triggering probability and variance modulated (TPVM) conditions, we propose a new variance-adaptive algorithm VAC$^2$-UCB and derive a regret bound $ ilde{O}(d\sqrt{T})$, which is independent of the batch-size $K$. As a valuable by-product, our analysis technique and variance-adaptive algorithm can be applied to the CMAB-T and C$^2$MAB setting, improving existing results there as well. We also include experiments that demonstrate the improved performance of our algorithms compared with benchmark algorithms on synthetic and real-world datasets.

연구 동기 및 목표

  • 다양한 응용 분야(예: 캐스케이딩 밴딧 및 영향력 최대화 등)를 모델링할 수 있는 일반적인 프레임워크를 문맥적 조합 밴딧에 대해 정식화하기 위해 확률적으로 촉발되는 암호를 가진 C²MAB-T를 제안한다.
  • 기존 연구의 한계를 해결하기 위해, 결정적 피드백을 가정하거나 $1/p_{\min}$ 또는 $K$에 의존하는 비최적의 손실 경계를 가지는 경우를 피한다.
  • 분산 조절과 같은 현실적인 부드러움 조건 하에서 $K$에 의존하지 않는 손실 경계를 달성하는 알고리즘을 개발한다.
  • 기존 결과에서 존재하는 $O(1/p_{\min})$ 요소를 제거함으로써 확장성과 성능을 향상시키는 정교한 분석을 제공한다.

제안 방법

  • 촉발 확률 조절 조건(TPM) 하에서 C²-UCB-T 알고리즘을 제안하며, 기존 결과에서 $1/p_{\min}$ 요소를 제거한 새로운 분석 기법을 사용하여 $\tilde{O}(d\sqrt{KT})$의 손실 경계를 달성한다.
  • 분산 조절(VM) 또는 촉발 확률 및 분산 조절(TPVM) 조건 하에서 분산 적응형 VAC²-UCB 알고리즘을 도입하여 $\tilde{O}(d\sqrt{T})$의 손실 경계를 달성하며, 이는 $K$에 의존하지 않는다.
  • 암호 결과의 분산에 적응하는 새로운 신뢰 구간 설계를 통해 더 날카운 손실 분석을 가능하게 한다.
  • 시간에 따라 변화하는 특징 매핑 $\bm{\phi}_t$를 사용하여 문맥 정보를 모델링하고, $\theta^*$에 대한 선형 평균 수익을 가정함으로써 확장성을 확보한다.
  • 반복적 피드백 모델을 일반화하기 위해 확률적 암호 촉발 프로세스를 적용하며, 반반 밴딧, 캐스케이딩 및 확률적 피드백을 포함한다.
  • 수익 함수의 부드러움 조건을 활용하여 기대 수익 갭과 암호 선택 빈도의 정교한 분석을 통해 손실 경계를 유도한다.

실험 결과

연구 질문

  • RQ1캐스케이딩 밴딧 및 영향력 최대화와 같은 기존 모델을 일반화하면서도 확장성을 유지할 수 있는 문맥적 조합 밴딧 프레임워크를 설계할 수 있는가?
  • RQ2실제 부드러움 가정 하에서 배치 크기 $K$와 최소 촉발 확률 $p_{\min}$에 의존하지 않는 손실 경계를 달성하는 것이 가능한가?
  • RQ3기존의 보수적인 탐색 전략에 비해 확률적으로 촉발되는 암호가 있는 설정에서 분산 적응형 알고리즘이 손실 성능을 향상시킬 수 있는가?
  • RQ4제안된 분석 기법은 기존의 조합 밴딧 연구에서 문제를 일으키는 $O(1/p_{\min})$ 요소를 어떻게 제거하는가?
  • RQ5새로운 알고리즘 및 분석 프레임워크는 CMAB-T 및 C²MAB 분야에서 기존 결과를 얼마나 향상시킬 수 있는가?

주요 결과

  • C²-UCB-T 알고리즘은 TPM 조건 하에서 $\tilde{O}(d\sqrt{KT})$의 손실 경계를 달성하며, 이는 이전 연구에서 존재하던 $O(1/p_{\min})$ 요소를 제거한 것이다.
  • VAC²-UCB 알고리즘은 VM 또는 TPVM 조건 하에서 $\tilde{O}(d\sqrt{T})$의 손실 경계를 달성하며, 이는 배치 크기 $K$에 의존하지 않는다.
  • 분석 기법과 분산 적응형 설계는 CMAB-T 및 C²MAB로도 이식 가능하며, 해당 분야의 기존 손실 경계를 향상시킨다.
  • 합성 및 실세계 데이터 세트에 대한 실험 결과는 제안된 알고리즘이 벤치마크 방법에 비해 뛰어난 성능을 보임을 보여준다.
  • 더 날카운 손실 경계는 기대 수익 갭의 정교한 분석과 분산에 따라 스케일링되는 적응형 신뢰 구간을 통해 달성된다.
  • 이 프레임워크는 문맥 기반 캐스케이딩 밴딧 및 영향력 최대화 밴딧 등 응용 분야로도 성공적으로 일반화되었으며, 증명 가능한 보장이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.