[論文レビュー] Nearly Optimal Regret for Stochastic Linear Bandits with Heavy-Tailed Payoffs
本稿では、重い尾を持つ報酬を持つ確率的線形バンディットに対して、中央値の平均と動的トリンケーションに基づく2つの新しいアルゴリズムを提案する。これらのアルゴリズムは、有限な$1+\epsilon$モーメントしか仮定しない。近似的に最適なレグレットバウンド$ widetilde{O}(d^{1/2}T^{1/(1+\epsilon)})$を確立し、$ epsilon=1$のときには対数要因を除いて下界と一致する。実験により、スチューデントの$ t $分布とパレートノイズの下での性能を検証した。
In this paper, we study the problem of stochastic linear bandits with finite action sets. Most of existing work assume the payoffs are bounded or sub-Gaussian, which may be violated in some scenarios such as financial markets. To settle this issue, we analyze the linear bandits with heavy-tailed payoffs, where the payoffs admit finite $1+ε$ moments for some $ε\in(0,1]$. Through median of means and dynamic truncation, we propose two novel algorithms which enjoy a sublinear regret bound of $\widetilde{O}(d^{\frac{1}{2}}T^{\frac{1}{1+ε}})$, where $d$ is the dimension of contextual information and $T$ is the time horizon. Meanwhile, we provide an $Ω(d^{\fracε{1+ε}}T^{\frac{1}{1+ε}})$ lower bound, which implies our upper bound matches the lower bound up to polylogarithmic factors in the order of $d$ and $T$ when $ε=1$. Finally, we conduct numerical experiments to demonstrate the effectiveness of our algorithms and the empirical results strongly support our theoretical guarantees.
研究の動機と目的
- 既存の確率的線形バンディットアルゴリズムが報酬が有界またはサブガウス型であると仮定しているという制限に対処する。これは、金融市場のような現実世界の状況では成り立たないことがある。
- 有限な$1+\epsilon$モーメント($\epsilon \in (0,1]$)を仮定するだけで、重い尾を持つ報酬分布に対して頑健なアルゴリズムを開発する。
- 有限アーム線形バンディットにおける、既存の上界と既知の下界との間のギャップを埋める。
- 情報理論的下界と対数要因を除いて一致する、きついレグレットバウンドを確立する。
提案手法
- 有限な$1+\epsilon$モーメントを持つ重い尾分布の下で、平均報酬を頑健に推定するために中央値の平均手法を採用する。
- 学習プロセスにおける極端な報酬値の影響を適応的に制御するために、動的トリンケーションを導入する。
- 2種類の異なるアルゴリズムを設計した—1つは中央値の平均推定を用い、もう1つはトリンケーションを用いる—両者とも有限な行動集合を想定した線形バンディット設定に特化している。
- 頑健統計を用いてパラメータ推定の高確率的信頼区間を導出し、重い尾ノイズ下でも安定性を保証する。
- 弱いモーメント仮定の下での集中不等式を組み合わせる、新しい分析フレームワークを用いてレグレットをバウンドする。
- $K$本のアームと$d$次元のコンテキストを持つ、巧みに構築されたハードインスタンスを用いて下界を確立し、レグレットのオーダーの最適性を証明する。
実験結果
リサーチクエスチョン
- RQ1報酬がサブガウス型や有界であると仮定する代わりに、有限な$1+\epsilon$モーメントしか持たない場合に、確率的線形バンディットでサブ線形レグレットを達成できるか?
- RQ2重い尾を持つ報酬仮定下で、時間の長さ$T$と次元$d$に対するレグレットの最適な依存関係は何か?
- RQ3対称的および非対称的な重い尾ノイズ分布に対して、両方に頑健な線形バンディットのアルゴリズムを設計できるか?
- RQ4$1+\epsilon$モーメントという最小限のモーメント仮定下で、$d$および$T$に対するレグレットバウンドはどのようにスケーリングするか?
主な発見
- 提案されたアルゴリズムは、有限な行動集合において、$\widetilde{O}(d^{1/2}T^{1/(1+\epsilon)})$のレグレットバウンドを達成し、先行研究に比べて$O(\sqrt{d})$の要因で改善されている。
- $\epsilon = 1$のとき、レグレットバウンドは$\widetilde{O}(\sqrt{dT})$となり、対数要因を除いてミニマックス下界と一致する。
- 下界として$\Omega(d^{\epsilon/(1+\epsilon)}T^{1/(1+\epsilon)})$が確立され、$T$におけるオーダーの最適性と、$d$におけるほぼ最適性が確認された。
- 数値実験では、提案されたアルゴリズムが、MoM、CRT、MENU、TOFUといった既存手法を上回ることを示した。これは、対称的(スチューデントの$ t $)および非対称的(パレート)の重い尾ノイズの両方の下で成立する。
- 中央値の平均バリアントであるSupBMMは、理論的バウンドにおけるきつい対数要因に一致する最小のレグレットを達成した。
- 結果は、中央値の平均や動的トリンケーションといった頑健推定手法が、弱いモーメント仮定下の線形バンディットにおいて有効であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。