Skip to main content
QUICK REVIEW

[論文レビュー] Regret Bounds for Reinforcement Learning with Policy Advice

Mohammad Gheshlaghi Azar, Alessandro Lazaric|May 5, 2013
Advanced Bandit Algorithms Research参考文献 14被引用数 14
ひとこと要約

本稿では、入力として与えられた決定的方策の集合を活用し、その集合に含まれる最良の方策に対する部分線形なリグレットを達成する、モデルフリーな強化学習アルゴリズムであるRLPAを提案する。これは、平均報酬の信頼区間を用いた不確実性下での楽観的アプローチを採用しており、状態空間や行動空間のサイズに依存しない$ olimits\widetilde{O}(\sqrt{T})$のリグレットバウンドを達成する。

ABSTRACT

In some reinforcement learning problems an agent may be provided with a set of input policies, perhaps learned from prior experience or provided by advisors. We present a reinforcement learning with policy advice (RLPA) algorithm which leverages this input set and learns to use the best policy in the set for the reinforcement learning task at hand. We prove that RLPA has a sub-linear regret of ilde O(\sqrt{T}) relative to the best input policy, and that both this regret and its computational complexity are independent of the size of the state and action space. Our empirical simulations support our theoretical analysis. This suggests RLPA may offer significant advantages in large domains where some prior good policies are provided.

研究の動機と目的

  • 完全なMDPモデルではなく、候補方策の集合として事前知識が得られる強化学習の課題に対処すること。
  • その集合に含まれる最良の方策に対するリグレットを最小化するように、これらの方策を動的に選択するアルゴリズムを設計すること。
  • 状態空間や行動空間のサイズに依存しない、リグレットと計算効率に関する理論的保証を確保すること。
  • 特に一般性と定常性仮定への依存のなさの面で、先行研究を上回る包括的な理論的分析を提供すること。
  • 状態空間や行動空間のサイズが大きいため、完全なMDP学習が非現実的となる大規模な環境における実用的導入を可能にすること。

提案手法

  • 問題を、$m$個の決定的方策$\Pi = \{\pi_1, \dots, \pi_m\}$の入力集合を有する強化学習タスクとして定式化する。
  • 各々の方策の推定平均報酬の上界信頼区間に基づいて、不確実性下での楽観的原則に従い方策を選択する。
  • 観測された報酬の累積値を用いて、各々の方策$\pi$の平均報酬の経験的推定値$\widehat{\mu}(\pi)$を維持する。
  • 集中不等式を用いて$\widehat{\mu}(\pi)$の周囲に信頼区間を構築し、探索と活用のバランスを取る。
  • 各時刻において、最も高い上界信頼区間を持つ方策を選択して行動選択をガイドする。
  • アルゴリズムのリグレットと計算コストが、状態数や行動数に依存せず、入力方策の数と時間枠にのみ依存することを保証する。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーな強化学習アルゴリズムは、与えられた入力方策集合における最良の方策に対する部分線形リグレットを達成できるか?
  • RQ2リグレットと計算複雑度が状態空間や行動空間のサイズに依存しないような、そのようなアルゴリズムを設計可能か?
  • RQ3アルゴリズムの性能は、入力方策の数と時間枠の増加に伴いどのようにスケーリングするか?
  • RQ4定常性や完全なモデル知識を仮定しないまま、強力な理論的保証を維持できるか?
  • RQ5事前方策が利用可能な大規模な環境において、標準的なRLベースラインを上回る性能を示せるか?

主な発見

  • RLPAアルゴリズムは、入力集合内の最良の方策に対するリグレットバウンドを$\widetilde{O}(\sqrt{T})$に達成する。ここで$T$は時間枠を表す。
  • このリグレットバウンドは、状態空間や行動空間のサイズに依存しないため、大規模または連続的ドメインに適している。
  • RLPAの計算複雑度も、状態数や行動数に依存せず、入力方策の数にのみ依存してスケーリングする。
  • 理論的分析は、MDPが定常的であるか一意鎖でないことを仮定しない一般条件のもとで成立する。
  • 実験的シミュレーションは理論的結果を裏付け、優れた事前方策が利用可能な環境で性能向上を示している。
  • 特に初期学習段階において、UCRLなどの標準的RL手法よりも優れた性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。