Skip to main content
QUICK REVIEW

[論文レビュー] Control-Aware Representations for Model-based Reinforcement Learning

Brandon Cui, Yinlam Chow|arXiv (Cornell University)|Jun 24, 2020
Reinforcement Learning in Robotics参考文献 27被引用数 8
ひとこと要約

本論文は、モデルベース強化学習における表現学習と制御を同時に最適化するフレームワークである制御認識表現学習(CARL)を紹介する。PCC原則に整合する損失関数を定式化し、潜在空間でiLQRの代わりにSACを採用することで、特に非線形環境において顕著な性能向上を達成した。これは、制御認識表現がPlanar、Swingup、Cartpoleなどのベンチマークタスクにおいて、標準的手法を上回ることを示している。

ABSTRACT

A major challenge in modern reinforcement learning (RL) is efficient control of dynamical systems from high-dimensional sensory observations. Learning controllable embedding (LCE) is a promising approach that addresses this challenge by embedding the observations into a lower-dimensional latent space, estimating the latent dynamics, and utilizing it to perform control in the latent space. Two important questions in this area are how to learn a representation that is amenable to the control problem at hand, and how to achieve an end-to-end framework for representation learning and control. In this paper, we take a few steps towards addressing these questions. We first formulate a LCE model to learn representations that are suitable to be used by a policy iteration style algorithm in the latent space. We call this model control-aware representation learning (CARL). We derive a loss function for CARL that has close connection to the prediction, consistency, and curvature (PCC) principle for representation learning. We derive three implementations of CARL. In the offline implementation, we replace the locally-linear control algorithm (e.g.,~iLQR) used by the existing LCE methods with a RL algorithm, namely model-based soft actor-critic, and show that it results in significant improvement. In online CARL, we interleave representation learning and control, and demonstrate further gain in performance. Finally, we propose value-guided CARL, a variation in which we optimize a weighted version of the CARL loss function, where the weights depend on the TD-error of the current policy. We evaluate the proposed algorithms by extensive experiments on benchmark tasks and compare them with several LCE baselines.

研究の動機と目的

  • モデルベースRLを用いて、生のセンサ観測から高次元動的システムを制御する課題に取り組む。
  • 従来のLCE手法が潜在空間で固定で非適応的な制御器(例:iLQR)を用いるという限界を克服する。
  • 表現学習と制御が共同で最適化されるエンドツーエンドフレームワークを構築し、性能を向上させる。
  • 制御アルゴリズムの選択と反復的改善が、表現品質および下流の制御性能に与える影響を調査する。
  • 予測精度、一貫性、ダイナミクスの滑らかさ(PCC原則)といった制御関連のインダクティブバイアスを組み込んだ損失関数を形式化する。

提案手法

  • 表現と制御のための共同目的関数を定式化する、潜在空間における制御認識表現学習フレームワークであるCARLを提案する。
  • PCC原則(予測、一貫性、曲率)と強い関連を持つCARL損失関数を導出することで、滑らかで予測可能な潜在ダイナミクスを促進する。
  • 3つの変種を実装する:オフラインCARL(iLQRをモデルベースSACに置き換え)、オンラインCARL(表現とポリシーの反復的共同学習)、バリューガイド付きCARL(TD誤差で重み付けされた損失)。
  • 表現学習には変分オートエンコーダ(VAE)を、潜在空間での遷移予測にはダイナミクスモデルを用いる。
  • 潜在空間でのポリシー最適化アルゴリズムとして、サンプル効率的で安定した学習を可能にするモデルベースSACを採用する。
  • バリューガイド付きCARLでは、現在のポリシーの時系列差分(TD)誤差を用いてCARL損失を再重み付けし、誤差が大きい領域や不確実性の高い領域に重点を置く。

実験結果

リサーチクエスチョン

  • RQ1制御アルゴリズムを学習目的に明示的に組み込むことで、表現学習を改善できるか?
  • RQ2潜在空間でiLQRの代わりにポリシー反復型のRLアルゴリズム(例:SAC)を採用することで、制御性能にどのような影響を与えるか?
  • RQ3オンライン更新による表現学習とポリシー最適化の入れ替えが、より優れた表現と制御をもたらすか?
  • RQ4TD誤差に基づく損失重み付けにより、制御が難しい領域に注目することで、性能をさらに向上させられるか?
  • RQ5非線形的かつ高次元な制御タスクにおいて、制御認識表現は標準的なLCE手法と比べてどのように異なるか?

主な発見

  • オフラインCARLは、Planar環境においてPCC(iLQRを用いる)を顕著に上回り、最悪モデルの平均ステップ数が33.46±4.61% 対 6.15±2.89% と優れた性能を示した。
  • Cartpole環境では、オフラインCARLが最良モデルで100.0±0.0% の成功率を達成し、PCCの99.85±0.08% を上回り、より優れたロバストネスを示した。
  • オンラインCARLは、オフラインCARLをさらに上回る性能を発揮し、反復的共同学習が表現品質と制御ポリシー効果を向上させることを示した。
  • バリューガイド付きCARLは、誤差の大きい領域に注目することで一般化性能を向上させた。性能のばらつきが減少し、非滑らかさのある潜在ダイナミクスに対しても良好な対応ができた。
  • 潜在空間の可視化により、SACを用いたCARLで学習された表現は、iLQRを用いたPCCに比べて、特に非線形環境において滑らかで局所的に線形に近いことが確認された。
  • 固定された開始状態とゴール状態でさえも、SOLARの性能はCARLの変種と比べて著しく低い水準に留まり、CARLの優れたサンプル効率と制御認識表現学習の優位性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。