Skip to main content
QUICK REVIEW

[論文レビュー] PlayVirtual: Augmenting Cycle-Consistent Virtual Trajectories for Reinforcement Learning

Tao Yu, Cuiling Lan|arXiv (Cornell University)|Jun 8, 2021
Reinforcement Learning in Robotics被引用数 14
ひとこと要約

PlayVirtualは、潜在空間におけるサイクル整合性のある仮想状態行動軌道を生成することで、深層強化学習におけるデータ効率を向上させる自己教師付き手法を提案する。前向きおよび後向きのダイナミクスモデルを用いて、拡張された行動から将来および過去の状態を予測し、特徴表現学習を正則化するためのサイクル整合性を強制することで、わずか100万回の環境インタラクションでAtariおよびDMControlで最先端の性能を達成する。

ABSTRACT

Learning good feature representations is important for deep reinforcement learning (RL). However, with limited experience, RL often suffers from data inefficiency for training. For un-experienced or less-experienced trajectories (i.e., state-action sequences), the lack of data limits the use of them for better feature learning. In this work, we propose a novel method, dubbed PlayVirtual, which augments cycle-consistent virtual trajectories to enhance the data efficiency for RL feature representation learning. Specifically, PlayVirtual predicts future states in the latent space based on the current state and action by a dynamics model and then predicts the previous states by a backward dynamics model, which forms a trajectory cycle. Based on this, we augment the actions to generate a large amount of virtual state-action trajectories. Being free of groudtruth state supervision, we enforce a trajectory to meet the cycle consistency constraint, which can significantly enhance the data efficiency. We validate the effectiveness of our designs on the Atari and DeepMind Control Suite benchmarks. Our method achieves the state-of-the-art performance on both benchmarks.

研究の動機と目的

  • 実際の軌道が限られた状況下での深層強化学習におけるデータ非効率性を解消すること。
  • 真の状態の教師信号に依存せずに特徴表現学習を改善すること。
  • サイクル整合性予測を用いて多様な仮想状態行動軌道を生成することで、データ効率を向上させること。
  • 特徴エンコーダーおよびダイナミクスモデルの両方を正則化する自己教師付き補助タスクを設計すること。
  • 最小限の現実世界の経験を用いて、標準的なRLベンチマークで最先端の性能を達成すること。

提案手法

  • 前向きダイナミクスモデルは、現在の潜在状態とサンプリングされた行動から将来の潜在状態を予測する。
  • 後向きダイナミクスモデルは、将来に予測された状態と同一の行動シーケンスから過去の潜在状態を予測する。
  • 仮想軌道は、前向きおよび後向きの予測を組み合わせて生成され、サイクルを形成する。
  • 元の現在状態と、後向き予測による再構成状態との距離を最小化することで、サイクル整合性を強制する。
  • 特徴表現の質を向上させるために、投影ヘッドを用いた潜在特徴におけるコントラスト型損失を用いる。
  • 主なRLポリシーとエンドツーエンドで訓練され、報酬信号とサイクル整合性損失のみを用いる。

実験結果

リサーチクエスチョン

  • RQ1真の状態の教師信号がなくても、仮想軌道生成は深層強化学習におけるデータ効率を向上させ得るか?
  • RQ2実データが限られた状況下で、サイクル整合性は特徴表現の正則化にどの程度効果的か?
  • RQ3潜在空間で行動を拡張することは、標準的なデータ拡張よりも優れたポリシー学習をもたらすか?
  • RQ4正則化と最適化の安定性のバランスをとるための最適な仮想軌道数は何か?
  • RQ5潜在空間または投影空間における距離尺度の選択が性能に与える影響は何か?

主な発見

  • Atari-100kでは47.2%のヒューマン正規化スコアを達成し、ベースライン比で10.1%の向上を示し、SOTA性能を達成した。
  • DMControl-100kでは中央値スコア797.0を記録し、ベースラインより70.5ポイント優れた。
  • サイクル整合性損失に投影空間($\mathcal{M}_{proj}$)を用いることで、原始的な潜在空間($\mathcal{M}_{latent}$)よりも優れた結果が得られ、Atariで2.4%の向上を示した。
  • 最適な仮想軌道数($M$)は約$3|\mathcal{A}|$であり、$M$が大きすぎたり小さすぎたりすると性能が低下した。
  • 主な性能向上の要因はダイナミクスモデルではなく、特徴エンコーダーへの正則化であり、優れた表現学習が鍵であることが示された。
  • 本手法は顕著にデータ効率を向上させ、わずか100万回の環境インタラクションでSOTA結果を達成し、Atariではヒューマンレベルの性能に相当する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。