Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Variational Reinforcement Learning for Complex Observations

Xiao Ma, Siwei Chen|arXiv (Cornell University)|Aug 6, 2020
Reinforcement Learning in Robotics参考文献 41被引用数 6
ひとこと要約

本稿では、複雑な視覚的観測においてピクセル単位の再構成を必要とせず、ロバストな潜在世界モデルを学習するための対照的変分強化学習(CVRL)を提案する。対照的目的関数を用いて状態と観測の間の相互情報量を最大化することで、動的影やごみだらけの背景を伴うタスクで最先端の手法を上回る性能を達成し、Natural Mujocoおよびボックスプッシュタスクで優れたサンプル効率を維持している。

ABSTRACT

Deep reinforcement learning (DRL) has achieved significant success in various robot tasks: manipulation, navigation, etc. However, complex visual observations in natural environments remains a major challenge. This paper presents Contrastive Variational Reinforcement Learning (CVRL), a model-based method that tackles complex visual observations in DRL. CVRL learns a contrastive variational model by maximizing the mutual information between latent states and observations discriminatively, through contrastive learning. It avoids modeling the complex observation space unnecessarily, as the commonly used generative observation model often does, and is significantly more robust. CVRL achieves comparable performance with state-of-the-art model-based DRL methods on standard Mujoco tasks. It significantly outperforms them on Natural Mujoco tasks and a robot box-pushing task with complex observations, e.g., dynamic shadows. The CVRL code is available publicly at https://github.com/Yusufma03/CVRL.

研究の動機と目的

  • 高次元で複雑な不要な視覚的干渉要因(動的影、移動する背景など)を含む観測において、深層強化学習における効果的な世界モデルを学習する課題に対処すること。
  • 生成的観測モデルの代わりに判別的対照的表現学習を用いることで、モデルベース強化学習におけるロバスト性とサンプル効率を向上させること。
  • ハイブリッドアクタークリティックと潜在変数誘導型モデル予測制御(MPC)フレームワークを用いて、複雑な環境における長時間スパンの計画と意思決定を可能にすること。
  • 対照的学習による相互情報量最大化が、複雑な観測下で従来の変分オートエンコーダーに基づく生成的モデリングよりも安定的かつ正確な世界モデルをもたらすことを示すこと。

提案手法

  • CVRLは、実際の状態-観測ペアと偽のペアを対比することで、潜在状態と観測の間の相互情報量を最大化する新しい目的関数、対照的証拠下限(CELBO)を導入する。
  • 本手法は、複雑な観測の直接再構成を避けるために、実際のペア(s_t, o_t)を負例ペア(s_t, o'_t)と比較することで表現を学習する対照的変分世界モデルを採用する。
  • SAC(ソフトアクタークリティック)を用いてハイブリッドアクタークリティカルポリシーを訓練し、特に高次元の複雑な観測空間においてもロバストで効率的なポリシー更新を実現する。
  • 長時間スパンの計画には、学習済みの世界モデルを活用する潜在変数誘導型モデル予測制御(MPC)を用いる。
  • CELBOで訓練された世界モデルとオンライン学習を統合することで、自然な環境下でのサンプル効率が高くロバストな意思決定が可能になる。
  • 負例はランダムな増幅または異なるトラジェクトリからサンプリングすることで生成され、対照的損失は関連する観測と関係のない観測を区別するようモデルを促進する。

実験結果

リサーチクエスチョン

  • RQ1対照的表現学習は、複雑な視覚的観測下におけるモデルベース強化学習における世界モデルのロバスト性を向上させることができるか?
  • RQ2生成的観測モデルを判別的対照的学習に置き換えることで、動的でごみだらけの背景を伴うタスクでの性能が向上するか?
  • RQ3対照的学習、潜在変数誘導型MPC、SACの組み合わせが、連続制御タスクにおける長時間スパンの意思決定をどのように改善するか?
  • RQ4各コンポonent(対照的学習、MPC、SAC)が、特に困難な環境下での全体的な性能に果たす寄与度は何か?
  • RQ5Dreamerなどの最先端のモデルベース強化学習手法と比較して、CVRLは複雑なタスクにおけるサンプル効率とロバスト性において優れているか?

主な発見

  • CVRLは、動的影や可変背景を含む複雑な観測を持つNatural Mujocoベンチマークで、最先端のモデルベース強化学習手法を顕著に上回った。
  • 複雑な視覚的干渉要因を伴うロボットボックスプッシュタスクでは、CVRLが最高の累積報酬と最短の実行時間(実行長さ)を達成し、DreamerおよびSACを上回った。
  • アブレーションスタディの結果、対照的学習コンポonentが不可欠であることが示された。CVRL-報酬のみおよびCVRL-生成的バージョンは顕著に性能が低く、対照的学習がロバスト性をもたらしていることが確認された。
  • 潜在変数誘導型MPCの削除(CVRL-no-MPC)により、10のタスク中8つで性能が低下し、特にカートポールスイングアップやクアッドロプットウォークのような長時間スパンのタスクで顕著だった。
  • ハイブリッドアクタークリティカル(CVRL-no-SAC)では、状態と観測の結合度が高いタスクで性能が低下した。これは、世界モデルの誤差が大きい際、SACが重要な訓練信号を提供していることを示している。
  • 観測が単純な標準Mujocoタスクでは、CVRLはDreamerと同等の性能を示したが、ウォーカーランおよびチータールンではわずかに性能が低かった。これは、観測の複雑さが低い場合には対照的学習が効果を発揮しない可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。