Skip to main content
QUICK REVIEW

[論文レビュー] Autoregressive Dynamics Models for Offline Policy Evaluation and Optimization

Michael R. Zhang, Thomas Paine|arXiv (Cornell University)|Apr 28, 2021
Gaussian Processes and Bayesian Inference参考文献 46被引用数 10
ひとこと要約

本論文では、直前の次元に条件づけられた状態および報酬次元を逐次的に予測する自己回帰的ダイナミクスモデルを提案する。このモデルは、状態に依存する依存関係のモデリングを改善する。提案手法は、MuJoCoベンチマークにおけるオフライン方策評価と最適化で最先端の性能を達成し、対応するフィードフォワードモデルや既存のOPEベースラインと比較して、対数尤度、価値推定、方策性能のすべての指標で優れている。

ABSTRACT

Standard dynamics models for continuous control make use of feedforward computation to predict the conditional distribution of next state and reward given current state and action using a multivariate Gaussian with a diagonal covariance structure. This modeling choice assumes that different dimensions of the next state and reward are conditionally independent given the current state and action and may be driven by the fact that fully observable physics-based simulation environments entail deterministic transition dynamics. In this paper, we challenge this conditional independence assumption and propose a family of expressive autoregressive dynamics models that generate different dimensions of the next state and reward sequentially conditioned on previous dimensions. We demonstrate that autoregressive dynamics models indeed outperform standard feedforward models in log-likelihood on heldout transitions. Furthermore, we compare different model-based and model-free off-policy evaluation (OPE) methods on RL Unplugged, a suite of offline MuJoCo datasets, and find that autoregressive dynamics models consistently outperform all baselines, achieving a new state-of-the-art. Finally, we show that autoregressive dynamics models are useful for offline policy optimization by serving as a way to enrich the replay buffer through data augmentation and improving performance using model-based planning.

研究の動機と目的

  • 標準的なフィードフォワードダイナミクスモデルが状態次元間の条件付き独立性を仮定するという限界を是正すること。
  • 遷移分布における複雑な依存関係をよりよく捉える表現力の高いダイナミクスモデルを学習することで、オフライン方策評価(OPE)を改善すること。
  • 提案されたダイナミクスモデルを用いたモデルベースのプランニングとデータ拡張を通じて、オフライン方策最適化を向上させること。
  • 自己回帰的モデリングが、既存のフィードフォワードおよびモデルフリーのベースラインと比較して、OPEおよびオフラインRLの両方で優れた性能をもたらすことを実証すること。

提案手法

  • モデルは、現在の状態・行動ペアに加え、直前の次元に条件づけて、次の状態および報酬の各次元を逐次的に予測する自己回帰的構造を採用する。
  • 各次元の条件付き分布を、以前の次元に条件づけてモデル化するために、正規化フローに類似したアーキテクチャを採用し、依存関係の柔軟かつ表現力のあるモデリングを可能にする。
  • モデルは、DM Control Suiteから抽出したホールドアウト遷移の尤度を最大化するように学習する。
  • オフライン方策最適化のため、モデルは合成遷移の生成によるデータ拡張およびモデル予測制御(MPC)プランニングのガイドとして使用される。
  • ベースラインのオフラインRLアルゴリズムとしてCritic Regularized Regression(CRR)を用い、プランニングとデータ拡張の両方を適用して評価する。
  • 本手法は、MuJoCoデータセットのRL Unpluggedスイート上で、フィードフォワードダイナミクスモデルおよび最先端のOPEベースラインと比較される。

実験結果

リサーチクエスチョン

  • RQ1自己回帰的ダイナミクスモデルは、対角線の共分散を仮定する標準的なフィードフォワードモデルと比較して、状態次元間の依存関係をよりよく捉えることができるか?
  • RQ2改善されたダイナミクスモデリングは、複数の指標にわたるオフライン方策評価(OPE)の性能向上に寄与するか?
  • RQ3自己回帰的ダイナミクスモデルは、データ拡張およびモデルベースのプランニングを通じて、オフライン方策最適化を向上させることができるか?
  • RQ4自己回帰的モデルによる性能向上は、RL Unpluggedベンチマークの多様な連続制御タスクにわたり一貫しているか?

主な発見

  • 自己回帰的ダイナミクスモデルは、DM Control Suiteの全9タスクにおいて、フィードフォワードモデルと比較して、ホールドアウト遷移の尤度が顕著に高い。
  • モデルは、中央絶対誤差、順位相関、正規化された上位5件の後悔のすべての指標で、すべてのベースラインOPE手法を上回り、9つの連続制御タスクで最先端の性能を達成した。
  • Cheetah-runおよびFish-swimタスクでは、自己回帰モデルに加えてプランニングとデータ拡張を適用した結果、以前の最先端性能を上回り、新たな最先端性能を達成した。
  • データ拡張およびプランニングに自己回帰モデルを用いることで、CRR expと比較して方策性能が向上し、複数のタスクで一貫した向上が得られた。
  • 自己回帰的ダイナミクスを用いたモデルベースのプランニングは、フィードフォワードモデルと比較して、より良い価値推定および方策性能をもたらした。
  • 結果から、状態次元間の依存関係をモデリングすることが、正確なダイナミクスモデリングおよび効果的なオフラインRLに不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。