[論文レビュー] Contextual bandits with surrogate losses: Margin bounds and efficient algorithms
本稿は、代理損失(特にラムプ損失およびハンジング損失)を用いた文脈的バンディットのための新しいフレームワークを導入し、マージンに基づくレグルレーションバウンドと効率的なアルゴリズムを導出する。d次元空間におけるリプシッツ的文脈的バンディットに対して、新たな$\tilde{O}(T^{d/(d+1)})$のレグルレーションバウンドを確立し、曲率仮定なしに$\tilde{O}(\sqrt{dT})$の誤りバウンドを持つ最初の効率的アルゴリズムであるHinge-LMCを提示する。
We use surrogate losses to obtain several new regret bounds and new algorithms for contextual bandit learning. Using the ramp loss, we derive new margin-based regret bounds in terms of standard sequential complexity measures of a benchmark class of real-valued regression functions. Using the hinge loss, we derive an efficient algorithm with a $\sqrt{dT}$-type mistake bound against benchmark policies induced by $d$-dimensional regressors. Under realizability assumptions, our results also yield classical regret bounds.
研究の動機と目的
- 部分的フィードバックを伴う文脈的バンディット設定へ、教師あり学習におけるマージンに基づく一般化理論を拡張すること。
- 特にハングイング損失を用いた凸代理損失を用いて、計算的に効率的な文脈的バンディットのためのアルゴリズムを開発すること。
- メトリックエントロピーおよびラデマッハ複雑度などの逐次的複雑度測度に基づく情報理論的レグルレーションバウンドを導出すること。
- 曲率仮定なしに$\sqrt{dT}$型の誤りバウンドを持つ最初の効率的アルゴリズムを提供することにより、バンディット多クラス予測における未解決問題を解決すること。
- 適応的ミニマックス解析とチェインジングの議論を用いて、リプシッツ的およびスムーズなバナッハ空間設定において、既存のレグルレーションバウンドを改善すること。
提案手法
- ベンチマーククラスの実数値回帰関数の逐次的メトリックエントロピーを用いて、ラムプ損失を用いてマージンに基づくレグルレーションバウンドを導出する。
- Fosterら(2015)の適応的ミニマックスフレームワークに加え、「適応的」なチェインジングの議論を組み合わせ、敵対的文脈的バンディットにおける部分的フィードバックを扱う。
- 指数的重み、ラングジン・モンテカルロによるサンプリング、およびハングイング損失の代理損失に基づく構造的アクション選択方式を用いるHinge-LMCという効率的アルゴリズムを提案する。
- 滑らかさを導入したFTRL(Follow-The-Leader)の変種としてSmoothFTLを提案し、リプシッツ的文脈的バンディットの確率的設定において情報理論的バウンドに一致する。
- 部分的フィードバックから不偏な損失推定を形成するために重要度重み付けを用い、バンディットフィードバック設定における安定な最適化を可能にする。
- パラメータ$\mu$を用いて滑らかさとレグルレーションのバランスを制御することで、探索と活用のトレードオフを適応的に制御する。
実験結果
リサーチクエスチョン
- RQ1教師あり学習で一般的なマージンに基づく一般化バウンドを、部分的フィードバックを伴う文脈的バンディット設定へ拡張できるか?
- RQ2実現可能性のもとで、d次元回帰関数によって誘導されるベンチマークポリシーが与えられたとき、文脈的バンディットで達成可能な最適なレグルレーションは何か?
- RQ3凸代理損失を用いて、曲率仮定なしに$\sqrt{dT}$型の誤りバウンドを持つ効率的アルゴリズムを設計できるか?
- RQ4メトリックエントロピーおよびラデマッハ複雑度などの逐次的複雑度測度は、敵対的文脈的バンディットにおけるレグルレーションをどのように特徴づけるか?
- RQ5非構成的ミニマックス解析の理論的保証を、部分的フィードバック設定においてアルゴリズム的に有効にできるか?
主な発見
- 本稿は、d次元メトリック空間におけるリプシッツ的文脈的バンディットに対して、新たな$\tilde{O}(T^{d/(d+1)})$のレグルレーションバウンドを確立し、Cesa-Bianchiら(2017)の以前の$\tilde{O}(T^{(d+1)/(d+2)})$の結果を改善する。
- 滑らかなバナッハ空間におけるバンディット多クラス予測において、本稿は$\tilde{O}(T^{2/3})$の誤りバウンドを達成し、Kakadeら(2008)の結果をバンディット設定へ拡張する。
- Hinge-LMCは、曲率仮定なしに代理損失を用いたバンディット多クラス予測に対して、$\sqrt{dT}$型の誤りバウンドを持つ最初の効率的アルゴリズムである。
- SmoothFTLは、リプシッツ的文脈的バンディットの確率的設定において、$\tilde{O}((KT)^{p/(p+1)})$のレグルレーションを達成する。ここで$p$は文脈空間のカバー次元である。
- 解析により、$\tilde{O}(T^{p/(p+1)})$バウンドが、同じ設定においてCesa-Bianchiら(2017)の$\tilde{O}(T^{(p+1)/(p+2)})$バウンドを改善することが示される。
- フレームワークはメトリック行動空間の設定へ一般化可能であり、行動空間のカバー次元が$p_{\mathcal{A}}$である場合、$\tilde{O}(T^{(p + p_{\mathcal{A}}p)/(p + p_{\mathcal{A}}p + 1)})$のバウンドが得られる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。