Skip to main content
QUICK REVIEW

[論文レビュー] Regret Balancing for Bandit and RL Model Selection

Yasin Abbasi-Yadkori, Aldo Pacchiano|arXiv (Cornell University)|Jun 9, 2020
Advanced Bandit Algorithms Research参考文献 2被引用数 9
ひとこと要約

この論文は、確率的バンディットおよび強化学習におけるモデル選択のためのレジットバランス戦略を提案する。エージェントは、すべての選択肢のパフォーマンスをバランスさせるために、最小の経験的レジットを示すベースアルゴリズムを選択する。この手法は安定性条件を必要とせず、近似的に最適なレジットを達成するが、近的最適性を達成するには最適なベースレジットの知識が必要であることを示している。

ABSTRACT

We consider model selection in stochastic bandit and reinforcement learning problems. Given a set of base learning algorithms, an effective model selection strategy adapts to the best learning algorithm in an online fashion. We show that by estimating the regret of each algorithm and playing the algorithms such that all empirical regrets are ensured to be of the same order, the overall regret balancing strategy achieves a regret that is close to the regret of the optimal base algorithm. Our strategy requires an upper bound on the optimal base regret as input, and the performance of the strategy depends on the tightness of the upper bound. We show that having this prior knowledge is necessary in order to achieve a near-optimal regret. Further, we show that any near-optimal model selection strategy implicitly performs a form of regret balancing.

研究の動機と目的

  • 最適なアルゴリズムが事前に不明である確率的バンディットおよび強化学習の設定において、複数のベース学習アルゴリズムの間から選択する課題に対処すること。
  • ベースアルゴリズムの変更なしに、オンラインで最良のパフォーマンスを示すベースアルゴリズムに適応するモデル選択戦略を開発すること。
  • ベースアルゴリズムが不安定であっても、近的最適なレジットを達成するには、レジットバランスが必要かつ十分であることを示すこと。
  • 近的最適なパフォーマンスを達成するには、最適なベースレジットの知識、またはアームフィードバックへの直接アクセスが必要であることを理論的に確立すること。
  • モデル選択フレームワークを線形MDPに拡張し、このような設定においてレジットバランスがタイトなレジットバウンドをもたらすことを示すこと。

提案手法

  • 各ベースアルゴリズムの経験的レジットをリアルタイムで推定し、各ステップで最小の経験的レジットを示すアルゴリズムを選択する。
  • すべてのベースアルゴリズムのレジットが類似した割合で増加するよう保証するため、目標レジット関数 $ U(t) $ を用いてバランスプロセスをガイドする。
  • 確率的バンディットおよび線形MDPの両方の設定に、レジットバランス戦略を適用し、強化学習設定ではLSVI-UCBをベースアルゴリズムとして用いる。
  • 最適なベースレジットが不明な場合に近的最適なパフォーマンスを達成できるように、強制的探索スキームを導入する。
  • 理論的解析を活用して、近的最適なモデル選択戦略は、暗黙的にレジットバランスを実行している必要があることを示す。
  • 最適なベースレジットの事前知識や直接的なアームサンプリングがなければ、いかなるモデル選択戦略も近的最適性を達成できないことを証明する。

実験結果

リサーチクエスチョン

  • RQ1安定性条件を要しないモデル選択戦略は、確率的バンディットおよび強化学習問題において、近的最適なレジットを達成できるか?
  • RQ2ベースアルゴリズムが不安定であっても、近的最適なレジットを達成するには、レジットバランスが必須条件であるか?
  • RQ3最適なベースレジットに関する事前知識が、モデル選択における近的最適なパフォーマンスの達成に果たす役割は何か?
  • RQ4レジットバランスは線形MDPに拡張可能か?そのような設定ではどのようなレジットバウンドが達成可能か?
  • RQ5近的最適なモデル選択戦略が暗黙的にレジットバランスを実行しなければならないような問題例は存在するか?

主な発見

  • LSVI-UCBを $ M $ 個の特徴マップで用いる場合、線形MDPにおいてレジットバランス戦略は $ \tilde{\mathcal{O}}(M\sqrt{d^{3}H^{3}T}) $ のレジットバウンドを達成する。
  • この戦略は、ベースアルゴリズムへの変更を一切必要としないため、UCB やトムソンサンプリングを含む任意の確率的バンディットアルゴリズムに適用可能である。
  • 近的最適性を達成する任意のモデル選択戦略は、下界の構築により、暗黙的にレジットバランスを実行している必要があることが示された。
  • 最適なベースレジットの知識が近的最適性の達成に不可欠であり、これを欠いていれば、最良のベースアルゴリズムのレジットよりも厳密に悪いレジットが生じる。
  • 強制的探索を導入することで、最適なベースレジットが不明であっても、レジットバランス戦略は近的最適性を達成できる。
  • 理論的解析により、レジットバランスは、広範な問題クラスにおける近的最適なモデル選択にとって十分かつ必須であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。