Skip to main content
QUICK REVIEW

[論文レビュー] Episodic Multi-armed Bandits

Cem Tekin, Mihaela van der Schaar|arXiv (Cornell University)|Aug 4, 2015
Advanced Bandit Algorithms Research参考文献 15被引用数 3
ひとこと要約

本稿では、エージェントがエピソード全体にわたり行動の順序を選び、各行動後にフィードバックを受け取り、'ストップ'行動によってエピソードを終了させることで終局的報酬と段階別コストを明らかにする、新しいオンライン学習フレームワークであるエピソード的マルチアームバンディット(eMAB)を導入する。提案されたFeedBALアルゴリズムは、エピソード数に応じてO(log n)の割合で成長する対数的レグレットを高確率で達成し、ステップ数、行動数、状態数に対して多項式的依存性を示す。

ABSTRACT

We introduce a new class of reinforcement learning methods referred to as {\em episodic multi-armed bandits} (eMAB). In eMAB the learner proceeds in {\em episodes}, each composed of several {\em steps}, in which it chooses an action and observes a feedback signal. Moreover, in each step, it can take a special action, called the $stop$ action, that ends the current episode. After the $stop$ action is taken, the learner collects a terminal reward, and observes the costs and terminal rewards associated with each step of the episode. The goal of the learner is to maximize its cumulative gain (i.e., the terminal reward minus costs) over all episodes by learning to choose the best sequence of actions based on the feedback. First, we define an {\em oracle} benchmark, which sequentially selects the actions that maximize the expected immediate gain. Then, we propose our online learning algorithm, named {\em FeedBack Adaptive Learning} (FeedBAL), and prove that its regret with respect to the benchmark is bounded with high probability and increases logarithmically in expectation. Moreover, the regret only has polynomial dependence on the number of steps, actions and states. eMAB can be used to model applications that involve humans in the loop, ranging from personalized medical screening to personalized web-based education, where sequences of actions are taken in each episode, and optimal behavior requires adapting the chosen actions based on the feedback.

研究の動機と目的

  • エピソードの終了までフィードバックが遅延する、行動の順序が結果に影響を与える順序的な意思決定問題に対処すること。
  • 治療法や教育法の順序が完了後にのみ評価される、個人に合わせた教育や医療の実世界応用をモデル化すること。
  • エピソード内でのフィードバックに適応し、現在のフィードバックに基づいて一時的(ミドル的な)に最適な行動を選択するベンチマークと比較してレグレットを最小化するオンライン学習アルゴリズムを設計すること。
  • エピソード数に対して対数的、システムサイズ(ステップ数、行動数、状態数)に対して多項式的に成長する理論的レグレットバウンドを確立すること。

提案手法

  • 学習がエピソード単位で進行するeMABを定式化し、各エピソードが順序的な行動、中間フィードバック、および終局的報酬とコストの公開を引き起こす'ストップ'行動を含むことを定義する。
  • 各ステップで現在のフィードバックに基づいて即時の期待利益を最大化する行動を選択するベンチマークを定義し、性能の基準として用いる。
  • フィードバックを用いてエピソード内での行動選択を適応的に最適化し、ベンチマークに対するレグレットを最小化するオンラインアルゴリズムであるFeedBack Adaptive Learning(FeedBAL)を提案する。
  • 期待利益の高確率的信頼区間を用いて行動選択をガイドし、不確実性に対してロバストな性能を確保する。
  • 集中不等式を用いてレグレットバウンドを導出し、期待レグレットがエピソード数に対して対数的に、システムサイズに対して多項式的に成長することを示す。
  • eMABが、オンライン適応的サブモジュラー最大化や、標準的MABと完全なMDPベースの強化学習の中間的枠組みとして、既存のモデルを一般化することを示す。

実験結果

リサーチクエスチョン

  • RQ1遅延フィードバックを伴うエピソード的設定において、最適な行動順序を効果的に学習できるオンライン学習アルゴリズムを設計できるか?
  • RQ2報酬がエピソードの終了後にのみ明らかであり、中間フィードバックが意思決定をガイドするフレームワークにおいて、レグレットをどのようにバウンドできるか?
  • RQ3リアルタイムのフィードバックに基づいて行動選択を適応的に変更するベンチマークと比較するアルゴリズムの理論的性能限界は何か?
  • RQ4エピソード数、1エピソードあたりのステップ数、およびシステム内の行動数や状態数が、レグレットにどのように影響するか?
  • RQ5eMABは、標準的マルチアームバンディット、MDPにおける強化学習、オンライン凸最適化とどのように一般化されたり異なっているか?

主な発見

  • FeedBALアルゴリズムは、高確率でエピソード数に対して対数的に成長する、具体的にはO(log n)のレグレットを達成する。
  • レグレットバウンドは、ステップ数、行動数、状態数に対して多項式的依存性を示し、中程度の大きさのシステムにおいてスケーラブルである。
  • 理論的分析により、FeedBALの期待レグレットが高確率で有界であることが証明され、信頼性の高い性能保証が得られる。
  • eMABは、オンライン適応的サブモジュラー最大化などの既存モデルを一般化し、標準的MABと完全なMDPベースのRLの中間的枠組みを提供する。
  • 人間が関与する意思決定の応用分野、特に完了後に評価される行動の順序が関係する、個人に合わせた教育や医療に適している。
  • OCOやSCOとは異なり、本モデルはエピソードごとにフィードバックに基づいて変化する適応的ベンチマークを基準としており、固定された行動を基準にしない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。