Skip to main content
QUICK REVIEW

[論文レビュー] Online and Offline Reinforcement Learning by Planning with a Learned Model

Julian Schrittwieser, Thomas Hubert|arXiv (Cornell University)|Apr 13, 2021
Reinforcement Learning in Robotics参考文献 31被引用数 26
ひとこと要約

本論文は Reanalyse を紹介する。モデルベースの計画手法で、学習済みモデルを用いて訓練ターゲットを改善し、MuZero がオンライン、オフライン、デモンストレーション駆動データのいずれの方式でも効果的に動作できるようにする。最終的に MuZero Unplugged はオンライン Atari とオフライン RL ベンチマークの両方で最先端の結果を達成する。

ABSTRACT

Learning efficiently from small amounts of data has long been the focus of model-based reinforcement learning, both for the online case when interacting with the environment and the offline case when learning from a fixed dataset. However, to date no single unified algorithm could demonstrate state-of-the-art results in both settings. In this work, we describe the Reanalyse algorithm which uses model-based policy and value improvement operators to compute new improved training targets on existing data points, allowing efficient learning for data budgets varying by several orders of magnitude. We further show that Reanalyse can also be used to learn entirely from demonstrations without any environment interactions, as in the case of offline Reinforcement Learning (offline RL). Combining Reanalyse with the MuZero algorithm, we introduce MuZero Unplugged, a single unified algorithm for any data budget, including offline RL. In contrast to previous work, our algorithm does not require any special adaptations for the off-policy or offline RL settings. MuZero Unplugged sets new state-of-the-art results in the RL Unplugged offline RL benchmark as well as in the online RL benchmark of Atari in the standard 200 million frame setting.

研究の動機と目的

  • オンラインRLでデータ効率を改善するため、保存データを再利用してより良い訓練ターゲットを生成する。
  • 環境の相互作用なしにデータセットから学習して完全なオフラインRLを実現する。
  • 単一のアルゴリズム(MuZero Unplugged)がオンライン、オフライン、デモベース学習を離散・連続アクション空間を横断して処理できることを示す。
  • 高次元の状態空間(ピクセル入力)とさまざまなデータ予算に対するスケーラビリティを示す。

提案手法

  • ストアされたデータから新しい訓練ターゲットを生成するために、モデルベースの方針および価値改善演算子を使用する。
  • MuZero の MCTS 計画と学習世界モデルと Reanalyse を統合して、p(方針)、v(値)、r(報酬)の更新済みターゲットを生成する。
  • 学習したモデルを K ステップ展開し、再分析済み軌跡から得られる多段TDターゲットで訓練する。
  • ツリ検索の改善された方針 pi_t と価値 z_t で訓練ターゲットを調整し、モデルとターゲットの改善の良循環を作る。
  • Reanalyse 分数を、環境相互作用から派生したターゲットと再分析データから派生したターゲットの比率として定義し、データ予算を制御する。

実験結果

リサーチクエスチョン

  • RQ1特別なオフポリシー適応なしに、オンラインRLとオフラインRLの両方で強い性能を達成できる単一のアルゴリズムは存在するか?
  • RQ2再分析のために学習済みモデルを過去データの再利用が、異なるデータ予算で学習効率にどう影響するか?
  • RQ3Reanalyse を MuZero と組み合わせることでデモンストレーションと純粋なオフラインデータセットから効果的に学習できるか?
  • RQ4ピクセルベースおよび連続アクションタスクでの MuZero Unplugged の性能は、専門のオフラインRLベースラインと比べてどうか?
  • RQ5統一された計画ベースのアプローチで実現可能なデータ予算制度(オンライン、オフライン、混合)はどれか?

主な発見

  • Reanalyse は、保存データを再利用してターゲットを改善することで、データ予算の桁違いにわたってデータ効率の良い学習を実現する。
  • MuZero Unplugged は RL Unplugged(オフライン Atari と連続制御)およびオンライン Atari ベンチマークで、特別なオフライン適応なしに最先端の結果を達成する。
  • Atari では、オフラインデータまたは混合予算を使用した場合、46ゲーム中44ゲームでベースラインを上回った。
  • MuZero Unplugged は連続制御タスクの DM Control Suite でもベースラインと同等かそれを上回る。
  • MCTS ベースのアクション選択と Reanalyse ロスの組み合わせが最良の性能を生み出し、MuZero Unplugged を堅牢な統一RL手法として確立している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。