[논문 리뷰] Online Bandits with (Biased) Offline Data: Adaptive Learning under Distribution Mismatch
이 논문은 분포가 충분히 가까울 경우 편향된 오프라인 데이터를 활용하지만, 불일치할 경우 이를 무시하는 적응형 온라인 밴디트 알고리즘인 MIN-UCB를 제안한다. 오프라인 데이터가 유용할 경우 UCB보다 엄밀히 향상된 리그레트 한계를 확립하며, 새로운 선형 프로그래밍 설정을 통해 인стан스에 의존적이고 독립적인 상한을 증명한다.
Traditional online learning models are typically initialized from scratch. By contrast, contemporary real-world applications often have access to historical datasets that can potentially enhanced the online learning processes. We study how offline data can be leveraged to facilitate online learning in stochastic multi-armed bandits and combinatorial bandits. In our study, the probability distributions that govern the offline data and the online rewards can be different. We first show that, without a non-trivial upper bound on their difference, no non-anticipatory policy can outperform the classical Upper Confidence Bound (UCB) policy, even with the access to offline data. In complement, we propose an online policy MIN-UCB for multi-armed bandits. MIN-UCB outperforms the UCB when such an upper bound is available. MIN-UCB adaptively chooses to utilize the offline data when they are deemed informative, and to ignore them otherwise. We establish that MIN-UCB achieves tight regret bounds, in both instance independent and dependent settings. We generalize our approach to the combinatorial bandit setting by introducing MIN-COMB-UCB, and we provide corresponding instance dependent and instance independent regret bounds. We illustrate how various factors, such as the biases and the size of offline datasets, affect the utility of offline data in online learning. We discuss several applications and conduct numerical experiments to validate our findings.
연구 동기 및 목표
- 분포가 가까울 경우 오프라인 데이터를 효과적으로 활용하는 온라인 밴디트 정책을 설계하는 것.
- 스토케스틱 밴디트에서 오프라인과 온라인 보상 분포 간의 분포 이탈 문제를 다루는 것.
- 유효한 편향 상한 하에서 인스턴스에 의존적이고 독립적인 리그레트 상한을 제공하는 것.
- 오프라인 데이터를 성능에 해를 끼치지 않도록 안전하게 활용할 수 있는 조건을 설정하는 것.
제안 방법
- 유효한 편향 상한 $V$를 기반으로 오프라인 데이터 사용 여부를 동적으로 결정하는 적응형 UCB 스타일 정책인 MIN-UCB를 제안한다.
- 온라인 탐색과 오프라인 데이터를 모두 포함하는 신뢰 구간을 사용하며, 데이터의 관련성 평가를 위한 임계값 메커니즘을 도입한다.
- 분포 불일치 하에서 최적의 리그레트 상한을 특성화하기 위해 새로운 선형 프로그래밍을 활용한다.
- 사슬 법칙과 KL 발산 상한을 적용하여 딱딱한 인스턴스에 대한 리그레트 하한을 유도한다.
- 다른 분포 설정 하에서 리그레트 하한을 증명하기 위해 이중 인스턴스 구성법을 도입한다.
- 통제된 평균 이동을 가진 가우시안 밴디트 인스턴스를 사용하여 $\sqrt{KT}$ 및 $T \cdot V_{\text{max}}$ 기반의 하한을 도출한다.
실험 결과
연구 질문
- RQ1오프라인 데이터가 존재하지만 편향될 수 있을 경우, 온라인 정책이 순수 UCB를 초월할 수 있는가?
- RQ2언제 오프라인 데이터가 리그레트를 향상시키며, 언제 이를 무시해야 하는가?
- RQ3편향된 오프라인 데이터를 가진 밴디트 학습에 대해 가장 날것의 리그레트 상한은 무엇인가?
- RQ4오프라인과 온라인 데이터 간의 분포 불일치 정도가 리그레트에 어떻게 영향을 미치는가?
- RQ5유효한 편향 상한 하에서 인스턴스에 의존적이고 독립적인 리그레트 상한을 동시에 날것으로 유지할 수 있는가?
주요 결과
- 분포 불일치에 대한 추가 정보 없이도 비예측 정책이 UCB를 초월할 수 없음을 보여주는 불가능성 결과를 도출한다.
- 오프라인 및 온라인 분포가 충분히 가까울 경우, 유효한 편향 상한 $V$로 측정된 바에 따라 MIN-UCB가 UCB보다 엄밀히 더 낮은 리그레트 상한을 달성한다.
- 분포가 동일한 경우 $P^{\text{(off)}} = P^{\text{(on)}}$일 때, MIN-UCB의 인스턴스에 의존적 리그레트 상한은 기존 최적 상한(2)과 일치하며, 이는 날것임을 증명한다.
- MIN-UCB의 인스턴스에 독립적인 리그레트 상한은 로그 인자까지의 차이를 제외하고는 날것이며, 이중 인스턴스 구성법을 통해 유도된 새로운 하한과 일치한다.
- 최적의 리그레트 상한은 분포 이탈 하에서 탐색과 이용 간의 트레이드오프를 특성화하는 새로운 선형 프로그래밍을 풀어야 한다.
- 수치 실험을 통해 오프라인 데이터가 정보가 많을 경우 MIN-UCB가 UCB를 능가하고, 그렇지 않을 경우 성능 저하를 피하는 것으로 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.