[論文レビュー] Online Bandits with (Biased) Offline Data: Adaptive Learning under Distribution Mismatch
本稿では、分布が十分に近い場合に偏りのあるオフラインデータを活用するが、不一致がある場合には無視する、適応的オンラインバンディットアルゴリズムであるMIN-UCBを提案する。オフラインデータが有用な場合、UCBより厳密に優れたレギュレートバウンドを確立し、新しい線形計画法の定式化により、インスタンス依存およびインスタンス独立のバウンドを厳密に証明する。
Traditional online learning models are typically initialized from scratch. By contrast, contemporary real-world applications often have access to historical datasets that can potentially enhanced the online learning processes. We study how offline data can be leveraged to facilitate online learning in stochastic multi-armed bandits and combinatorial bandits. In our study, the probability distributions that govern the offline data and the online rewards can be different. We first show that, without a non-trivial upper bound on their difference, no non-anticipatory policy can outperform the classical Upper Confidence Bound (UCB) policy, even with the access to offline data. In complement, we propose an online policy MIN-UCB for multi-armed bandits. MIN-UCB outperforms the UCB when such an upper bound is available. MIN-UCB adaptively chooses to utilize the offline data when they are deemed informative, and to ignore them otherwise. We establish that MIN-UCB achieves tight regret bounds, in both instance independent and dependent settings. We generalize our approach to the combinatorial bandit setting by introducing MIN-COMB-UCB, and we provide corresponding instance dependent and instance independent regret bounds. We illustrate how various factors, such as the biases and the size of offline datasets, affect the utility of offline data in online learning. We discuss several applications and conduct numerical experiments to validate our findings.
研究の動機と目的
- 分布が近い場合に効果的にオフラインデータを利用できるオンラインバンディット方策を設計すること。
- ステochasticバンディットにおけるオフラインとオンラインの報酬分布の間の分布シフトの課題に対処すること。
- 有効なバイアスバウンドのもとで、インスタンス依存およびインスタンス独立のレギュレートバウンドがきわめて厳密であることを提供すること。
- オフラインデータを性能を損なわずに安全に活用できる条件を確立すること。
提案手法
- 有効なバイアスバウンド $V$ を用いて、オフラインデータの使用を動的に選択する、UCB風の適応的方策であるMIN-UCBを提案する。
- オンラインの探索とオフラインデータの両方を組み込んだ信頼区間を用い、データの関連性を評価するためのしきい値機構を導入する。
- 分布の不一致下での最適レギュレートバウンドを特徴付けるために、新しい線形計画法を用いる。
- チェーンルールとKLダイバージェンスのバウンドを適用し、困難なインスタンスにおけるレギュレートの下界を導出する。
- 異なる分布設定下でのレギュレートの下界を証明するために、二つのインスタンスを用いた構成を導入する。
- 制御された平均シフトを伴うガウス・バンディットインスタンスを用い、$\sqrt{KT}$ および $T \cdot V_{\text{max}}$ の観点から下界を導出する。
実験結果
リサーチクエスチョン
- RQ1オフラインデータが利用可能であるが、偏りがある場合に、オンライン方策がバニラUCBを上回ることができるか?
- RQ2どのような条件下でオフラインデータがレギュレートを改善できるのか? また、いつ無視すべきか?
- RQ3偏りのあるオフラインデータを用いたバンディット学習における、最もきわめて厳密なレギュレートバウンドは何か?
- RQ4オフラインとオンラインの分布の不一致度合いに応じて、レギュレートはどのように依存するか?
- RQ5有効なバイアスバウンドのもとで、インスタンス依存およびインスタンス独立の両方のレギュレートバウンドを同時にきわめて厳密に達成できるか?
主な発見
- 分布の不一致に関する追加情報がなければ、非予測可能な方策はUCBを上回ることはできない。これは、不可能性の結果を示している。
- オフラインとオンラインの分布が十分に近い場合、MIN-UCBは有効なバイアスバウンド $V$ で定量化された状況において、UCBより厳密に優れたレギュレートバウンドを達成する。
- 分布が $P^{\text{(off)}} = P^{\text{(on)}}$ の場合、MIN-UCBのインスタンス依存レギュレートバウンドは、既知の最適バウンド(2)と一致し、タイトネスを示している。
- MIN-UCBのインスタンス独立レギュレートバウンドは、対数因子を除きタイトであり、二つのインスタンスを用いた構成により導出された新しい下界と一致する。
- 最適レギュレートバウンドは、新しい線形計画法を解くことで得られ、分布シフト下での探索と報酬のトレードオフを特徴付ける。
- 数値実験により、オフラインデータが有用な場合にMIN-UCBがUCBを上回ること、一方でデータが不適切な場合には劣化を回避することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。