Skip to main content
QUICK REVIEW

[論文レビュー] Improved Path-length Regret Bounds for Bandits

Sébastien Bubeck, Yuanzhi Li|arXiv (Cornell University)|Jan 29, 2019
Advanced Bandit Algorithms Research参考文献 26被引用数 6
ひとこと要約

本稿は、適応的でない敵対的環境下において、特に大きなパス長の場合に、先行研究よりもタイトなパス長レギュレーター境界を確立する。多腕バンディットと線形バンディットの両方の問題に対して、新たな技術を用いた最適化された楽観的ミラー降下フレームワークを提案する。具体的には、適応的楽観的予測、最近選択された腕へのバイアス、ハイブリッド正則化子を導入する。線形バンディットの文脈では、凸体追跡を介して結果を拡張し、この分野で初めてパス長レギュレーター境界を確立する。

ABSTRACT

We study adaptive regret bounds in terms of the variation of the losses (the so-called path-length bounds) for both multi-armed bandit and more generally linear bandit. We first show that the seemingly suboptimal path-length bound of (Wei and Luo, 2018) is in fact not improvable for adaptive adversary. Despite this negative result, we then develop two new algorithms, one that strictly improves over (Wei and Luo, 2018) with a smaller path-length measure, and the other which improves over (Wei and Luo, 2018) for oblivious adversary when the path-length is large. Our algorithms are based on the well-studied optimistic mirror descent framework, but importantly with several novel techniques, including new optimistic predictions, a slight bias towards recently selected arms, and the use of a hybrid regularizer similar to that of (Bubeck et al., 2018). Furthermore, we extend our results to linear bandit by showing a reduction to obtaining dynamic regret for a full-information problem, followed by a further reduction to convex body chasing. We propose a simple greedy chasing algorithm for squared 2-norm, leading to new dynamic regret results and as a consequence the first path-length regret for general linear bandit as well.

研究の動機と目的

  • 時間やラウンド数だけでなく、損失変動のパス長に基づいて性能を測ることで、バンディット問題におけるレギュレーター境界を改善すること。
  • 適応的敵対的環境下における先行研究のパス長境界の限界を解明し、一部の境界が根本的に改善できないことを示すこと。
  • 適応的および非適応的敵対的両方の環境下で、Weiら(2018)よりタイトなレギュレーター境界を達成する新しいアルゴリズムの設計。
  • 一般線形バンディット設定へのパス長レギュレーター境界分析の拡張、これはこれまで未解決であった。
  • 一般線形バンディットのパス長レギュレーター境界を、完全情報問題における動的レギュレーターと凸体追跡に還元する新しい還元法の確立。

提案手法

  • 損失のトレンドをよりよく予測できる新たな楽観的予測メカニズムを備えた、楽観的ミラー降下フレームワークの適応。
  • 非ステーショナリ環境への対応性を高めるために、最近選択された腕にバイアスをかける。
  • Bubeckら(2018)にインspiredされた、l1およびl2型の項を組み合わせたハイブリッド正則化子を採用し、スパarsityと滑らかさの両立を図る。
  • 新たな変換を用いて、線形バンディット問題を完全情報設定下の動的レギュレーター問題に還元する。
  • 動的レギュレーター問題を、既存のアルゴリズムと境界を活用して凸体追跡問題にさらに還元する。
  • この還元の連鎖を用いて、一般線形バンディットに対して初めてパス長レギュレーター境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1適応的敵対的環境下において、Weiら(2018)の最先端の境界を超えるパス長レギュレーター境界を達成できるか?
  • RQ2Weiら(2018)のパス長境界は、適応的敵対的環境下で根本的にタイトであるか、それ以上に改善可能か?
  • RQ3適応的楽観的予測や腕の履歴バイアスといった新たなアルゴリズム的技術が、より良いレギュレーター性能をもたらすか?
  • RQ4パス長レギュレーター境界を多腕バンディットからより一般的な線形バンディット設定に拡張できるか?
  • RQ5動的レギュレーターと凸体追跡の関係を活用して、線形バンディットにおける新しいパス長境界を導出できるか?

主な発見

  • 適応的敵対的環境下では、Weiら(2018)のパス長境界が根本的に改善できないことが証明され、限界が確立された。
  • より小さいパス長測定を用いることで、Weiら(2018)を厳密に上回る新しいアルゴリズムを提案し、よりタイトなレギュレーター境界を達成した。
  • 非適応的敵対的環境下では、パス長が大きい場合に、新しいアルゴリズムが先行研究を上回る性能を示した。
  • 凸体追跡への還元により、一般線形バンディットに対して初めてパス長レギュレーター境界を確立した。
  • 還元フレームワークにより、新たな動的レギュレーターの結果が得られ、複雑なバンディット設定におけるパス長分析の可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。