Skip to main content
QUICK REVIEW

[論文レビュー] Nonstochastic Bandits with Composite Anonymous Feedback

Nicolò Cesa‐Bianchi, Tommaso Cesari|arXiv (Cornell University)|Dec 6, 2021
Advanced Bandit Algorithms Research被引用数 21
ひとこと要約

本稿は、過去の行動からの損失が未来のラウンドに敵対的に分散される、合成匿名フィードバックを伴う非確率的バンディット設定を導入する。任意の標準バンディットアルゴリズムを、このフィードバック構造に耐性を持つものに変換する一般化された還元手法を提案し、Tsallisエントロピーを用いた最適化されたFTRLに対して、$ sqrt{(d+1)KT}$のレグレットバウンドを達成する。これは対数要因を除いて最適である。

ABSTRACT

We investigate a nonstochastic bandit setting in which the loss of an action is not immediately charged to the player, but rather spread over the subsequent rounds in an adversarial way. The instantaneous loss observed by the player at the end of each round is then a sum of many loss components of previously played actions. This setting encompasses as a special case the easier task of bandits with delayed feedback, a well-studied framework where the player observes the delayed losses individually. Our first contribution is a general reduction transforming a standard bandit algorithm into one that can operate in the harder setting: We bound the regret of the transformed algorithm in terms of the stability and regret of the original algorithm. Then, we show that the transformation of a suitably tuned FTRL with Tsallis entropy has a regret of order $\sqrt{(d+1)KT}$, where $d$ is the maximum delay, $K$ is the number of arms, and $T$ is the time horizon. Finally, we show that our results cannot be improved in general by exhibiting a matching (up to a log factor) lower bound on the regret of any algorithm operating in this setting.

研究の動機と目的

  • 損失が未来のラウンドに敵対的に分散される非確率的バンディット設定を形式化し、合成損失を形成する。
  • 標準バンディットアルゴリズムを、この合成匿名フィードバックに耐性を持つものに変換する一般ラッパーを開発する。
  • 変換されたTsallisエントロピーを用いたFTRLアルゴリズムに対して、$ sqrt{(d+1)KT}$のレグレットバウンドを確立する。
  • 対数要因を除いて一致する(下限の)レグレットバウンドを証明し、導出されたレグレットバウンドの最適性を示す。

提案手法

  • 損失の再重み付けとスケーリングにより、標準バンディットアルゴリズムを合成匿名フィードバックに耐性を持つものに変換する一般還元手法を提案する。
  • 遅延および合成損失構造を適切に処理できるようにチューニングされた、Tsallisエントロピーを用いた変更版FTRLアルゴリズムをベースアルゴリズムとして使用する。
  • Dekelら(2014b)にインspiredされたラウンド分類スキーム(ドロー、ステイ、アップデート)を導入し、レグレット解析を更新タイミングから分離する。
  • 変数変換を適用し、補題2を活用して、遅延$d$に依存する項を過大評価せずに正しくバウンドする。
  • 敵対的アドバーシャリーが$T/d$の時間ステップに高額な損失を集約できる下限インスタンスを構築し、$ Omega(\sqrt{(d+1)KT})$のレグレットが避けられないことを示す。

実験結果

リサーチクエスチョン

  • RQ1標準バンディットアルゴリズムを、損失が未来のラウンドに分散される合成匿名フィードバックに対応させるための体系的アプローチは可能か?
  • RQ2遅延が$d$まで敵対的である非確率的バンディット設定において、達成可能な最適なレグレットは何か?
  • RQ3$\sqrt{(d+1)KT}$のレグレットバウンドはタイトか、それ以上に改善可能か?
  • RQ4合成フィードバックの構造は、標準的な遅延フィードバックと比較して、オンライン学習アルゴリズムの設計にどのように影響を与えるか?

主な発見

  • 提案されたラッパー変換により、変換されたアルゴリズムのレグレットは元のアルゴリズムの安定性とレグレットに依存することが保証され、合成フィードバックへの一般化が可能になる。
  • Tsallisエントロピーを用いたFTRLに適用した場合、変換されたアルゴリズムは$ sqrt{(d+1)KT}$のレグレットバウンドを達成し、対数要因を除いて標準非確率的バンディットにおける最高の既知のバウンドと一致する。
  • 対数要因を除いて一致する下限$ Omega(\sqrt{(d+1)KT})$が確立され、導出されたレグレットバウンドが対数要因を除いて最適であることが証明された。
  • 下限は、敵対的アドバーシャリーが少数の時間ステップに高額な損失を集約できる能力に依存しており、これはi.i.d.遅延モデルには存在しない特徴であり、単純な解析手法を無効にしている。
  • 予備版における2つの欠陥を是正した:$d$ラウンドにわたる損失蓄積に関する誤ったバウンド、および確率の符号付き差分を含む誤った不等式。これらは新しい解析フレームワークにより解決された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。