[논문 리뷰] Double Thompson Sampling for Dueling Bandits
이 논문은 이중 톰슨 샘플링(D-TS)을 제안한다. D-TS는 이원 비교에서 양쪽 암을 독립적으로 톰슨 샘플링을 통해 선택함으로써 효율적인 탐색을 가능하게 하고, 비정보성 있는 자기 비교를 피할 수 있다. 일반 코페란드 이중 밴딧에서 D-TS는 $O(K^2\log T)$의 리그레트를 달성하며, 콘도르세 및 실용적인 코페란드 설정에서는 이를 $O(K\log T + K^2\log\log T)$로 개선한다. D-TS+는 더 나은 타이브레이킹 전략을 통해 경험적 성능을 향상시키는 개선된 버전이다.
In this paper, we propose a Double Thompson Sampling (D-TS) algorithm for dueling bandit problems. As indicated by its name, D-TS selects both the first and the second candidates according to Thompson Sampling. Specifically, D-TS maintains a posterior distribution for the preference matrix, and chooses the pair of arms for comparison by sampling twice from the posterior distribution. This simple algorithm applies to general Copeland dueling bandits, including Condorcet dueling bandits as its special case. For general Copeland dueling bandits, we show that D-TS achieves $O(K^2 \log T)$ regret. For Condorcet dueling bandits, we further simplify the D-TS algorithm and show that the simplified D-TS algorithm achieves $O(K \log T + K^2 \log \log T)$ regret. Simulation results based on both synthetic and real-world data demonstrate the efficiency of the proposed D-TS algorithm.
연구 동기 및 목표
- 자기 비교에서 정보가 없고 학습 알고리즘이 갇힐 수 있는 문제를 해결하기 위해 톰슨 샘플링을 이중 밴딧에 적용하는 데 도전한다.
- 일반 코페란드 이중 밴딧, 특히 콘도르세 케이스를 포함한 선호 공간을 효과적으로 탐색할 수 있는 확장 가능하고 강인한 알고리즘을 설계한다.
- 상호의존적인 암 선택과 비정보성 비교의 어려움을 극복하여, 톰슨 샘플링 기반 이중 밴딧 알고리즘의 리그레트를 이론적으로 경계한다.
- D-TS의 타이브레이킹 전략을 개선하여 경험적 성능을 향상시키고, 이론적 보장을 유지하면서 D-TS+로 이어지는 개선을 이룬다.
제안 방법
- D-TS는 선호 행렬에 대한 사후 분포에서 두 개의 샘플 세트를 독립적으로 추출하여 비교에 사용할 첫 번째 및 두 번째 암을 선택한다.
- 알고리즘은 RUCB와 RLCB 신뢰 구간을 사용하여 열등한 암을 제거함으로써 비정보성 비교에 갇히는 것을 방지한다.
- 첫 번째 후보를 고정하고 다른 암들과의 비교를 표준 MAB 문제로 간주함으로써, D-TS는 알려진 톰슨 샘플링 분석 기법을 활용하여 이론적 리그레트 경계를 유도한다.
- 콘도르세 및 실용적인 코페란드 이중 밴딧 설정에서 리그레트 경계를 개선하기 위해 백서브스티튜션 추론을 적용하여 로그 인자인 $\log T$ 를 $\log\log T$ 로 감소시킨다.
- D-TS+는 샘플링 과정에서 타이브레이킹을 정교하게 처리함으로써 D-TS를 향상시키며, 특히 다수의 코페란드 승자 존재 시나리오에서 경험적 성능을 향상시킨다.
- 알고리즘은 MSLR 및 순환 선호 행렬을 포함한 다양한 합성 및 실세계 데이터셋에서 피드백 지연과 시간 수평이 다양할 때 평가되었다.
실험 결과
연구 질문
- RQ1자기 비교에서 정보가 없음에도 불구하고 톰슨 샘플링이 이중 밴딧에 효과적으로 적용될 수 있는가?
- RQ2일반 코페란드 이중 밴딧 설정에서 이중 샘플링 톰슨 샘플링 접근법의 이론적 리그레트 경계는 무엇인가?
- RQ3이중 샘플링 구조는 UCB 유형 또는 MED 유형 알고리즘 대비 탐색 효율성 향상과 리그레트 감소에 어떻게 기여하는가?
- RQ4백서브스티튜션 추론을 통해 콘도르세 및 실용적인 코페란드 이중 밴딧 설정에서 표준 $O(K^2\log T)$를 초월해 리그레트 경계를 개선할 수 있는가?
- RQ5D-TS에서 정교한 타이브레이킹 전략은 경험적 리그레트와 강인성에 측정 가능한 향상을 가져오는가?
주요 결과
- 일반 코페란드 이중 밴딧에서 D-TS는 암의 수에 따라 이론적으로 스케일러블한 $O(K^2\log T)$ 리그레트를 달성한다.
- 콘도르세 이중 밴딧 및 대부분의 실용적인 코페란드 설정에서는 백서브스티튜션 추론을 통해 리그레트가 $O(K\log T + K^2\log\log T)$로 개선된다.
- D-TS+는 타이브레이킹 전략을 향상시켜 D-TS보다 경험적 성능을 향상시키며, 특히 다수의 코페란드 승자가 존재하는 경우에 뚜렷한 개선을 보인다.
- 실험 결과 D-TS와 D-TS+는 CCB, ECW-RMED, RUCB와 같은 기존 알고리즘보다 리그레트와 강인성 측면에서 뚜렷이 뛰어나며, 특히 피드백 지연 상황에서도 유사하다.
- 비콘도르세 설정에서의 비선형 리그레트를 방지하기 위해 RUCB/RLCB 제거 단계가 핵심적이다. 이 단계를 제거할 경우 일부 경우에서 선형 리그레트가 발생한다.
- D-TS와 D-TS+는 MSLR(콘도르세) 및 순환 선호 행렬(비콘도르세)을 포함한 다양한 데이터셋에서 피드백 지연이 최대 300개 시간슬롯까지 있어도 강력한 성능을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.