Skip to main content
QUICK REVIEW

[論文レビュー] PLAS: Latent Action Space for Offline Reinforcement Learning

Wenxuan Zhou, Sujay Bajracharya|arXiv (Cornell University)|Nov 14, 2020
Reinforcement Learning in Robotics参考文献 22被引用数 13
ひとこと要約

本稿では、条件付き変分オートエンコーダ(CVAE)を用いて学習された潜在空間において方策を訓練する、offline強化学習のためのPLAS(Policy in the Latent Action Space)を提案する。この方法により、行動はデータセットのサポート内に暗黙的に制約され、明示的な発散制約(例:KLやMMD)に依存しない。本手法は、連続的制御ベンチマークおよび実ロボットの変形可能物体の操作タスクにおいて、最先端の性能を達成し、明示的制約を用いる手法を上回る。また、Q関数の一般化が良好な場合に、摂動層を介して制御された分布外一般化を可能にする。

ABSTRACT

The goal of offline reinforcement learning is to learn a policy from a fixed dataset, without further interactions with the environment. This setting will be an increasingly more important paradigm for real-world applications of reinforcement learning such as robotics, in which data collection is slow and potentially dangerous. Existing off-policy algorithms have limited performance on static datasets due to extrapolation errors from out-of-distribution actions. This leads to the challenge of constraining the policy to select actions within the support of the dataset during training. We propose to simply learn the Policy in the Latent Action Space (PLAS) such that this requirement is naturally satisfied. We evaluate our method on continuous control benchmarks in simulation and a deformable object manipulation task with a physical robot. We demonstrate that our method provides competitive performance consistently across various continuous control tasks and different types of datasets, outperforming existing offline reinforcement learning methods with explicit constraints. Videos and code are available at https://sites.google.com/view/latent-policy.

研究の動機と目的

  • 分布外行動に起因する外挿誤差の問題に対処すること。
  • 明示的な発散制約(例:KLやMMD)に依存せず、データセットのサポート内に方策を暗黙的に制約する手法を開発すること。
  • データセット内での一般化を可能にしつつ、Q関数の一般化が良好な場合には制御された分布外行動選択を許容すること。
  • 実世界のロボット操作タスクを含む、多様なデータセットおよび環境において一貫した性能を示すこと。

提案手法

  • 静的データセットから行動方策の行動分布をモデル化するため、条件付き変分オートエンコーダ(CVAE)を学習する。
  • CVAEの潜在空間において方策を学習し、生成されるすべての行動が構築上、データセットのサポート内に収まるようにする。
  • 環境との相互作用のために、CVAEデコーダを用いて潜在行動を元の行動空間にマッピングする。
  • Q関数の一般化が良好な場合に、分布外行動の制御された探索を可能にする摂動層を導入する。
  • 潜在行動方策を用いて、offline RLの目的関数(例:TD学習)を最適化し、行動分布に対する明示的な正則化を回避する。
  • インディストリビューション一般化(潜在空間による)とアウトオブディストリビューション一般化(摂動層による)を分離し、細かく制御可能にする。

実験結果

リサーチクエスチョン

  • RQ1学習された潜在行動空間で学習することで、明示的な発散制約が不要な状態で、方策がデータセットの行動サポート内に暗黙的に制約されるか。
  • RQ2BEAR、BCQ、BRACなどの明示的制約を用いる既存のoffline RL手法と比較して、PLASの性能は多様なデータセットでどのように異なるか。
  • RQ3摂動層を介して分布外行動を許容することで、どのような状況で性能が向上し、摂動の大きさはどのように調整すべきか。
  • RQ4PLASは、実世界のロボットタスク(例:変形可能物体の操作)において、offlineデータのみを用いて効果的に一般化できるか。

主な発見

  • PLASは、d4rl連続的制御ベンチマークにおいて、BEAR、BCQ、BRACを含む既存のoffline RL手法を複数のデータセットで上回る性能を達成した。
  • Walker2d-mediumデータセットでは、摂動なしで正規化スコア44.6、ε=0.1で66.9を達成し、ベースラインを著しく上回った。
  • Q関数推定における平均二乗誤差(MSE)が一貫して低く抑えられており、BEAR や BRAC よりも全体的なQ値の精度が優れていた。
  • Q関数予測における過大評価または過小評価バイアスは最小限に抑えられ、状態-行動ペア全体にわたる誤差分布がバランスが取れていた。
  • 摂動層により、ランダムデータセット(例:Hopper-randomスコアはε=0.5で10.5から13.3に向上)において性能が向上したが、medium-expertおよびmedium-replayデータセットでは性能が低下した。
  • 実ロボット実験では、PLASはofflineデータのみを用いて変形可能物体の操作タスクのための方策を成功裏に学習し、実用的応用の有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。