Skip to main content
QUICK REVIEW

[論文レビュー] Task-Agnostic Dynamics Priors for Deep Reinforcement Learning

Yilun Du, Karthik Narasimhan|arXiv (Cornell University)|May 13, 2019
Reinforcement Learning in Robotics参考文献 38被引用数 10
ひとこと要約

本論文は、新しい空間記憶アーキテクチャ(SpatialNet)を用いて、動画データからタスクに依存しないダイナミクス事前知識を学習することで、モデルベース強化学習におけるサンプル効率と一般化性能を向上させることを提案する。多様な物理的動画データ上でフレーム予測器を事前学習し、ターゲットタスクで微調整することで、より高速なポリシー学習と優れた性能が達成される。PhysShooterではベースライン比最大130%高い性能、Asteroidsでは56.5%高い性能を達成した。

ABSTRACT

While model-based deep reinforcement learning (RL) holds great promise for sample efficiency and generalization, learning an accurate dynamics model is often challenging and requires substantial interaction with the environment. A wide variety of domains have dynamics that share common foundations like the laws of classical mechanics, which are rarely exploited by existing algorithms. In fact, humans continuously acquire and use such dynamics priors to easily adapt to operating in new environments. In this work, we propose an approach to learn task-agnostic dynamics priors from videos and incorporate them into an RL agent. Our method involves pre-training a frame predictor on task-agnostic physics videos to initialize dynamics models (and fine-tune them) for unseen target environments. Our frame prediction architecture, SpatialNet, is designed specifically to capture localized physical phenomena and interactions. Our approach allows for both faster policy learning and convergence to better policies, outperforming competitive approaches on several different environments. We also demonstrate that incorporating this prior allows for more effective transfer between environments.

研究の動機と目的

  • モデルフリー深層強化学習におけるサンプル非効率性と一般化性能の低さに取り組む。
  • 限られた相互作用しか得られない新しい環境で、ダイナミクスモデルをゼロから正確に学習する難しさを克服する。
  • 運動、衝突、弾性といった、多様な環境に共通する物理的事前知識を活用し、モデルベース強化学習の性能を向上させる。
  • 非構造化動画データから得た事前学習済み事前知識を初期化として用いることで、ダイナミクスモデルを初期化し、より高速で安定したポリシー学習を可能にする。
  • ダイナミクスモデル学習とポリシー学習を分離することで、異なるタスクを持つ環境間でダイナミクス事前知識を独立して転移可能とし、ゼロショットおよびフェイントショット転移性能を向上させる。

提案手法

  • 移動する物体や物理的相互作用を示す多数の非構造的動画データ上で、フレーム予測モデル(SpatialNet)を事前学習する。
  • 空間的記憶ブロックを備えた畳み込みエンコーダ、3次元空間記憶ブロック、畳み込みデコーダからなるSpatialNetを設計し、微細な空間的・時間的ダイナミクスを保持する。
  • 事前学習済みSpatialNetを、モデルベース強化学習エージェントのダイナミクスモデルの初期化として用い、その後タスク固有の経験データで微調整する。
  • 予測された将来のフレームを、IPAフレームワークと同様にポリシーネットワークの追加コンテキストとして統合し、意思決定性能を向上させる。
  • ダイナミクスモデル学習とポリシー学習を分離することで、異なるタスクを持つ環境間でダイナミクス事前知識を独立して転移可能とする。
  • 本手法を3つのドメインに適用:PhysWorld(2次元物理ゲーム)、PhysShooter3D(3次元剛体ダイナミクス)、ストキャスティックなStickyアクション付きAtariゲーム。

実験結果

リサーチクエスチョン

  • RQ1多様な物理的動画データ上でフレーム予測器を事前学習することで、強化学習におけるサンプル効率を向上させる汎用性のあるダイナミクス事前知識が得られるか?
  • RQ2タスクに依存しないダイナミクス事前知識を用いることで、ランダム初期化からの学習と比較して、ポリシー学習の速度と最終的性能にどのような影響を与えるか?
  • RQ3物理的ダイナミクスが類似するがタスクが異なる環境間で、事前学習済みダイナミクスモデルがどの程度転送可能か?
  • RQ4ダイナミクスモデル学習とポリシー学習を分離することで、一般化性能と転移性能が向上するか?
  • RQ5どのような状況下でダイナミクス予測が性能向上に寄与し、逆に有害となる場合があるか?

主な発見

  • 提案手法は、最も強力なベースライン(IPA)と比較して、PhysShooter環境で最大130%高い性能を達成した。
  • AtariゲームのAsteroidsでは、ベースライン比56.5%高い性能を達成し、最終スコアは2098(±102)であったのに対し、ベースラインは1340(±351)であった。
  • 別のタスク(例:PhysForage)で微調整した事前学習済みSpatialNetモデルを転送することで、PhysVideosのみを用いた場合と比較して27%の性能向上が得られ、PhysShooterで53.66のスコアを達成した。
  • ポリシーを含まないダイナミクスモデルの転送のみが、モデルとポリシーを両方転送する場合(40.40)よりも高い性能(53.66)を達成した。これは、分離による利点を示している。
  • Pong や Ice Hockey のような環境では、エージェントが繰り返しの戦略を学習し、悪用可能な状況に陥ったが、この場合、ダイナミクス予測は効果を示さなかった。これは、本手法の利点が文脈に依存することを確認した。
  • SpatialNetアーキテクチャは、局所的な物理的相互作用を保持する空間記憶メカニズムのおかげで、先行手法と比較してより低いフレーム予測誤差と優れた一般化性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。