Skip to main content
QUICK REVIEW

[論文レビュー] Task-agnostic Exploration in Reinforcement Learning

Xuezhou Zhang, Yuzhe Ma|arXiv (Cornell University)|Jun 16, 2020
Reinforcement Learning in Robotics参考文献 25被引用数 13
ひとこと要約

本稿では、報酬関数が存在しない状況でMDPを探索するエージェントを導入するタスクに依存しない強化学習フレームワークを提案する。その後、収集した軌道とサンプルされた報酬を用いて、N個の任意のタスクに対して近似的に最適な方策を効率的に計算する。提案されたUCBZeroアルゴリズムは、$ ilde{O}("log(N)H^5SA/^2)$のサンプル複雑度を達成し、この設定における$og(N)$依存性が不可避であることを示す下界を提示する。

ABSTRACT

Efficient exploration is one of the main challenges in reinforcement learning (RL). Most existing sample-efficient algorithms assume the existence of a single reward function during exploration. In many practical scenarios, however, there is not a single underlying reward function to guide the exploration, for instance, when an agent needs to learn many skills simultaneously, or multiple conflicting objectives need to be balanced. To address these challenges, we propose the extit{task-agnostic RL} framework: In the exploration phase, the agent first collects trajectories by exploring the MDP without the guidance of a reward function. After exploration, it aims at finding near-optimal policies for $N$ tasks, given the collected trajectories augmented with extit{sampled rewards} for each task. We present an efficient task-agnostic RL algorithm, extsc{UCBZero}, that finds $ε$-optimal policies for $N$ arbitrary tasks after at most $ ilde O(\log(N)H^5SA/ε^2)$ exploration episodes. We also provide an $Ω(\log (N)H^2SA/ε^2)$ lower bound, showing that the $\log$ dependency on $N$ is unavoidable. Furthermore, we provide an $N$-independent sample complexity bound of extsc{UCBZero} in the statistically easier setting when the ground truth reward functions are known.

研究の動機と目的

  • 探索段階で特定の報酬関数が利用できない状況における、強化学習における効率的探索の課題に対処すること。
  • 一度の報酬なし探索フェーズの後、複数の任意のタスクに対して近似的に最適な方策を学習できるフレームワークを設計すること。
  • 報酬ガイダンスなしで学習するという性質を反映した、タスクに依存しない強化学習の理論的サンプル複雑度境界を確立すること。
  • この設定において、サンプル複雑度に$og(N)$依存性が不可避であることを示すこと。
  • タスク固有、報酬なし、タスクに依存しない強化学習のパラダイムを統一的に理論的比較すること。

提案手法

  • エージェントは報酬信号なしでMDPを探索し、不確実性の下での楽観主義原理に従って軌道を収集する。
  • UCBZeroは報酬値に依存せず、訪問回数にのみ依存するHoeffding型のボーナスを用いる。これにより、タスクに依存しない設定への適用が可能になる。
  • 探索終了後、各タスクのためのサンプル報酬を付加することで、収集した軌道をもとにN個のタスクに対する近似的に最適な方策を計算する。
  • アルゴリズムはすべての状態-行動ペアが十分に訪問されることを保証し、収集された遷移から正確なダイナミクスモデル推定を可能にする。
  • 理論的分析では、Azuma-Hoeffdingの集中不等式とシミュレーション補題の議論を組み合わせ、N依存およびN非依存の境界を導出する。
  • 下界として$mega(\log(N)H^2SA/\u0001^2)$が確立され、タスクに依存しない設定において$og(N)$スケーリングが不可避であることが示された。

実験結果

リサーチクエスチョン

  • RQ1学習段階で事前に指定された報酬関数が利用できない状況でも、強化学習において効率的探索を達成できるか?
  • RQ2一度の報酬なし探索フェーズのみを用いて、N個の任意のタスクに対する近似的に最適な方策を学習することは可能か?
  • RQ3タスクに依存しない強化学習における根本的なサンプル複雑度の限界は何か? また、タスク数Nに伴ってどのようにスケーリングされるか?
  • RQ4タスクに依存しない強化学習の統計的難易度は、タスク固有および報酬なし強化学習設定と比べてどう異なるか?
  • RQ5真の報酬が既知である統計的に容易な設定において、タスクに依存しないサンプル複雑度境界を達成できるか?

主な発見

  • UCBZeroは、報酬なし探索の後、N個のタスクに対して$psilon$-最適方策を求める際、$ilde{O}(\log(N)H^5SA/\u0001^2)$のサンプル複雑度を達成する。
  • 同様の下界$mega(\log(N)H^2SA/\u0001^2)$が存在し、性能がほぼ最適であることが示された。
  • UCBZeroはすべての状態-行動ペアが十分に頻繁に訪問されることを保証し、収集した軌道から正確なダイナミクスモデル推定が可能になる。
  • 訪問回数にのみ依存するHoeffding型ボーナスは、タスクに依存しない探索を可能にする上で極めて重要である。
  • 真の報酬が既知である統計的に容易な設定では、UCBZeroは$\tilde{O}(H^6S^2A^2(\log(3H/\u0001)+\iota)/\u0001^2)$のN非依存サンプル複雑度境界を達成する。
  • 理論的分析により、統計的難易度の明確な階層が明らかになった:タスク固有RL < 報酬なしRL < タスクに依存しないRL。後者では、探索段階での報酬ガイダンスの欠如により$og(N)$スケーリングが必要となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。