Skip to main content
QUICK REVIEW

[論文レビュー] The Challenges of Exploration for Offline Reinforcement Learning

Nathan Lambert, Markus Wulfmeier|arXiv (Cornell University)|Jan 27, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本稿では、タスクに依存しない方法で環境を探索するための内発的動機づけに基づく好奇心を用いた手法を用いて、オフライン強化学習におけるデータ収集と方策推論を分離するフレームワークであるExplore2Offlineを提案する。報酬再ラベル付けを用いたオフラインRLによってデータ品質を評価し、タスクに依存しない探索が、後続のタスクに有効なデータセットを生成できることを示している。提案された内発的モデル予測制御(IMPC)エージェントは、オンラインRLによるデータ収集と同等の性能を達成している。

ABSTRACT

Offline Reinforcement Learning (ORL) enablesus to separately study the two interlinked processes of reinforcement learning: collecting informative experience and inferring optimal behaviour. The second step has been widely studied in the offline setting, but just as critical to data-efficient RL is the collection of informative data. The task-agnostic setting for data collection, where the task is not known a priori, is of particular interest due to the possibility of collecting a single dataset and using it to solve several downstream tasks as they arise. We investigate this setting via curiosity-based intrinsic motivation, a family of exploration methods which encourage the agent to explore those states or transitions it has not yet learned to model. With Explore2Offline, we propose to evaluate the quality of collected data by transferring the collected data and inferring policies with reward relabelling and standard offline RL algorithms. We evaluate a wide variety of data collection strategies, including a new exploration agent, Intrinsic Model Predictive Control (IMPC), using this scheme and demonstrate their performance on various tasks. We use this decoupled framework to strengthen intuitions about exploration and the data prerequisites for effective offline RL.

研究の動機と目的

  • タスクに依存しない探索によって収集されたデータの品質が、後続のオフライン強化学習に与える影響を調査すること。
  • 好奇心に基づく内発的探索が、未知の複数のタスクを効果的に解けるデータセットを生成できるかどうかを評価すること。
  • モデル予測制御と内発的好奇心を組み合わせた新しい探索エージェント、内発的モデル予測制御(IMPC)の開発とベンチマーク化すること。
  • 強化学習におけるデータ収集と方策推論のプロセスを分離するフレームワークを用いて分離すること。
  • 無教師データ収集に適用された現在のオフラインRLアルゴリズムのデータ効率、転送性、限界についての実証的洞察を提供すること。

提案手法

  • タスク知識なしで内発的報酬を用いて探索するエージェントが環境を探索する第一段階と、収集した経験をタスク固有の報酬に再ラベル付けし、オフラインRLに使用する第二段階からなる二段階フレームワーク「Explore2Offline」を提案する。
  • 収集されたリプレイバッファからの再ラベル付けデータを学習するため、オフラインRLアルゴリズムとしてCritic Regularized Regression(CRR)を用いる。
  • 学習済みのダイナミクスモデルと単一状態の好奇心報酬を組み合わせて、探索のためのオンライン計画を導く、内発的モデル予測制御(IMPC)を導入する。
  • 世界モデルの予測誤差に基づく内発的好奇心報酬を用い、未知の状態の探索を促進する。
  • 同じデータセット上で、ランダム、好奇心ベース、およびIMPCのさまざまなデータ収集戦略を比較し、複数の後続タスクへの転送性能を評価する。
  • さまざまなタスクのゴール状態にスパarsely +1の報酬を再ラベル付けすることで、タスクの難易度が上昇する中でのデータ転送性の評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1内発的好奇心に基づくタスクに依存しない探索によって、未知のタスクに対する有効なオフライン方策学習が可能なデータセットが得られるか?
  • RQ2好奇心ベースのエージェントが収集したデータに基づいて学習された方策の性能は、同じタスクに対してオンラインRLで収集されたデータに基づいて学習された方策と比べてどうか?
  • RQ3異なるデータ収集戦略が、難易度の異なるタスクにおける後続タスクへの転送性能に与える影響は何か?
  • RQ4好奇心ベースのエージェントが収集したデータの品質と後続タスクの性能の相関関係は何か?また、成功を予測するのに最も予測可能なデータの特性は何か?
  • RQ5内発的探索によって収集された1つのデータセットが、ゴール状態が異なる複数の後続タスクにどれほど一般化可能か?

主な発見

  • ランダム探索エージェントが好奇心ベースの手法と同等の品質のデータを収集しており、徹底的な探索がオフラインRLに十分なデータの多様性を提供できることを示唆している。
  • 好奇心ベースのエージェントが収集したデータに基づいて学習された方策は、訓練タスクにおいてオンラインRLのベースラインと同等の性能を達成しており、タスクに依存しないデータ収集の有効性を示している。
  • 内発的モデル予測制御(IMPC)エージェントは、複数の後続タスクにおいて他の好奇心ベースの手法を上回り、より高いデータ効率と探索品質を示している。
  • タスクに依存しない探索によって収集されたデータは、特に難易度の高いタスクにおいても強力な転送性能を示しており、ゴールの不一致に対しても頑健であることが示された。
  • タスク-エージェントペアごとのパフォーマンスに顕著なばらつきが見られ、オフラインRLアルゴリズム(例:CRR)の選択とデータ品質、タスク構造との相互作用が顕著に影響していることが示された。
  • 本研究は、データ品質が探索戦略にのみ依存するのではなく、データの特性とオフラインRLアルゴリズムとの相互作用にも依存することを強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。