Skip to main content
QUICK REVIEW

[論文レビュー] Online learning with feedback graphs and switching costs

Anshuka Rangi, Massimo Franceschetti|arXiv (Cornell University)|Oct 23, 2018
Advanced Bandit Algorithms Research参考文献 32被引用数 5
ひとこと要約

本稿は、フィードバックグラフとスイッチングコストを伴うオンライン学習における期待リグレットの下界を導出する。標準的なアルゴリズムはスイッチングコストが存在しない場合には最適であるが、コストが存在する場合には非最適となることを示す。本稿では、対称的部分情報およびマルチアームバンディット設定において、順序的に最適なリグレットを達成する2つの新しいアルゴリズム—Threshold Based EXP3 および EXP3.SC—を提案する。実験評価では、Threshold Based EXP3 が既存手法を上回る性能を示した。

ABSTRACT

We study online learning when partial feedback information is provided following every action of the learning process, and the learner incurs switching costs for changing his actions. In this setting, the feedback information system can be represented by a graph, and previous works studied the expected regret of the learner in the case of a clique (Expert setup), or disconnected single loops (Multi-Armed Bandits (MAB)). This work provides a lower bound on the expected regret in the Partial Information (PI) setting, namely for general feedback graphs --excluding the clique. Additionally, it shows that all algorithms that are optimal without switching costs are necessarily sub-optimal in the presence of switching costs, which motivates the need to design new algorithms. We propose two new algorithms: Threshold Based EXP3 and EXP3. SC. For the two special cases of symmetric PI setting and MAB, the expected regret of both of these algorithms is order optimal in the duration of the learning process. Additionally, Threshold Based EXP3 is order optimal in the switching cost, whereas EXP3. SC is not. Finally, empirical evaluations show that Threshold Based EXP3 outperforms the previously proposed order-optimal algorithms EXP3 SET in the presence of switching costs, and Batch EXP3 in the MAB setting with switching costs.

研究の動機と目的

  • 部分情報(PI)設定におけるフィードバックグラフとスイッチングコストを伴うオンライン学習の期待リグレットに対する下界を確立すること。
  • スイッチングコストが存在しない場合に最適なアルゴリズムが、スイッチングコストが導入されると必然的に非最適になることの証明。
  • PI設定においてリグレットとスイッチングコストの両方をバランスさせる新しいアルゴリズムの設計。
  • 提案されたアルゴリズムの性能を、既存の最先端手法と比較して実験的に評価すること。

提案手法

  • 任意のフィードバックグラフ列 G₁,…,GT に対して、独立系列番号 β(G₁:T) を用いて期待リグレットの下界を導出する。
  • 観測された損失を用いて行動選択を動的に調整し、リグレットとスイッチングコストのバランスを取る、Threshold Based EXP3 を提案する。
  • スイッチングコストに適応したEXP3の変種として、修正された探索戦略を用いる EXP3.SC を導入する。
  • 時間変動するフィードバックグラフにおけるリグレットバウンドを特徴付けるために、mas(G)(最大無閉路部分グラフサイズ)を用いる。
  • 損失推定値とコストペナルティの両方を考慮して、確率更新ルールを変更することで、EXP3フレームワークにスイッチングコストを統合する。
  • 変動するフィードバックグラフ構造とスイッチングコストの下で、性能を評価するために敵対的損失生成器を用いたシミュレーションを実施する。

実験結果

リサーチクエスチョン

  • RQ1部分情報設定におけるフィードバックグラフとスイッチングコストを伴うオンライン学習の、期待リグレットの根本的下界は何か?
  • RQ2なぜ、スイッチングコストなし設定で順序的に最適な既存のアルゴリズムが、スイッチングコストが導入されると非最適になるのか?
  • RQ3PI設定において、時間 T とスイッチングコスト c の両方に関して順序的に最適なリグレットを達成する新しいアルゴリズムを設計可能か?
  • RQ4スイッチングコストが存在する状況下で、Threshold Based EXP3 と EXP3.SET の性能はどのように比較されるか?
  • RQ5MAB および PI 設定において、観測されたフィードバック情報の使用が、リグレットとスイッチングコストのトレードオフを顕著に改善するか?

主な発見

  • スイッチングコストを伴うPI設定における任意のアルゴリズムの期待リグレットは、β(G₁:T) が独立系列番号であるとき、少なくとも Õ(c¹ᐟ³β(G₁:T)¹ᐟ³T²ᐟ³) 以上である。
  • Threshold Based EXP3 は、時間不変PI設定において Õ(c¹ᐟ³mas(G)¹ᐟ³T²ᐟ³) のリグレットを達成し、c および T に関して順序的に最適である。
  • EXP3.SC は Õ(c⁴ᐟ³mas(G)²ᐟ³T²ᐟ³) のリグレットを達成するが、下界と比較してスイッチングコスト c に関して非最適である。
  • スイッチングコストが存在するPI設定において、Threshold Based EXP3 は EXP3.SET を上回る性能を示し、後者はリグレットとスイッチング回数の両方で線形増加を示した。
  • MAB設定において、Threshold Based EXP3 は Batch EXP3 を上回り、特に T が増加するにつれてその差が顕著になった。これは、観測損失情報の有効な活用によるものである。
  • β(G₁:T) が小さくなるほど、アルゴリズム間の性能差が拡大する傾向があり、これはスイッチングコスト下でのリグレット最小化においてフィードバック構造の重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。