[論文レビュー] Contrastive Variational Model-Based Reinforcement Learning for Complex Observations.
本稿では、複雑な視覚的観測条件下でのロバスト性とサンプル効率を向上させるために、対照的変分世界モデルを用いるモデルベース強化学習フレームワーク、対照的変分強化学習(CVRL)を提案する。対照的学習を通じて潜在状態と観測値の間の相互情報量を最大化することで、Natural Mujoco、つまり自然な視覚的観測を持つ新しいベンチマークにおいて、最先端の生成的MBRL手法を上回る性能を達成する。
Deep model-based reinforcement learning (MBRL) has achieved great sample-efficiency and generalization in decision making for sophisticated simulated tasks, such as Atari games. However, real-world robot decision making requires reasoning with complex natural visual observations. This paper presents Contrastive Variational Reinforcement Learning (CVRL), an MBRL framework for complex natural observations. In contrast to the commonly used generative world models, CVRL learns a contrastive variational world model by maximizing the mutual information between latent states and observations discriminatively by contrastive learning. Contrastive learning avoids modeling the complex observation space and is significantly more robust than the standard generative world models. For decision making, CVRL discovers long-horizon behavior by online search guided by an actor-critic. CVRL achieves comparable performance with the state-of-the-art (SOTA) generative MBRL approaches on a series of Mujoco tasks, and significantly outperforms SOTAs on Natural Mujoco tasks, a new, more challenging continuous control RL benchmark with complex observations introduced in this paper.
研究の動機と目的
- 複雑な自然な視覚的観測下におけるモデルベース強化学習におけるサンプル効率とロバスト性の課題に対処すること。
- 高次元の観測空間における生成的世界モデルの限界を克服するため、潜在状態と観測値の相互情報量を最大化するための対照的学習を導入すること。
- オンラインのアクター・クリティックによる探索を用いることで、自然な視覚入力を用いた連続制御タスクにおける効果的な長時間スパンの意思決定を可能にすること。
- 複雑で自然な観測を持つ連続制御タスクのための新しいベンチマークであるNatural Mujocoを導入・評価し、現実世界のロボット学習の課題をよりよく反映すること。
- 対照的学習に基づく世界モデルが、生成モデルと同等またはそれを上回る性能を発揮する一方で、複雑な観測に対してよりロバストであることを示すこと。
提案手法
- CVRLは、対照的学習を用いて潜在状態と観測値の間の相互情報量を最大化することで、潜在表現を学習する対照的変分世界モデルを採用する。
- 対照的学習の目的関数は、観測値とそれに対応する潜在状態のペア(正例と負例)を用いて定式化され、複雑な観測空間の確率密度推定を直接行わない。
- 変分推論フレームワークを用いて世界モデルを訓練することで、エンドツーエンドの微分可能で、視覚入力に対してスケーラブルな学習が可能になる。
- 意思決定は、世界モデルを用いて長時間スパンの行動計画を行うオンライン探索によって実現され、アクター・クリティック方策がそのガイドとして機能する。
- 世界モデルは、模倣学習と強化学習の目的関数を組み合わせて訓練される方策ネットワークと統合される。
- 本手法は、標準的なMuJoCo環境および、実世界の視覚的観測を用いる新規に導入されたNatural MuJoCoベンチマークで評価される。
実験結果
リサーチクエスチョン
- RQ1対照的変分世界モデルは、複雑な視覚的観測下におけるモデルベース強化学習のサンプル効率とロバスト性を向上させ得るか?
- RQ2標準的および自然な視覚的制御ベンチマークにおいて、CVRLは最先端の生成的MBRL手法と比較して、性能とサンプル効率の面で優れているか?
- RQ3生成モデルと比較して、対照的学習は、複雑な観測分布の明示的モデリングの必要性をどの程度低減するか?
- RQ4自然な視覚入力を用いた環境において、CVRLはオンライン探索を用いて長時間スパンの行動を効果的に発見できるか?
- RQ5提案されたNatural Mujocoベンチマークは、複雑な観測下における現実世界の強化学習一般化の評価に意味のある挑戦を提供するか?
主な発見
- CVRLは、標準的なMuJoCoタスクにおいて、最先端の生成的MBRL手法と同等の性能を達成し、競争力のあるサンプル効率と方策品質を示した。
- 複雑な自然な視覚的観測を持つ新規に導入されたNatural MuJoocoベンチマークにおいて、CVRLは既存の最先端の生成的MBRLアプローチを顕著に上回った。
- 対照的変分世界モデルは、観測分布の完全なモデリングを行わずに、複雑な観測から関連する情報を効果的に捉え、ロバスト性を向上させた。
- 対照的学習の導入により、標準的な生成モデルと比較して、高次元の視覚空間におけるより優れた分離性と表現学習が実現された。
- 世界モデル内でのオンラインアクター・クリティックガイド付き探索により、複雑な視覚環境における効果的な長時間スパンの計画が可能になった。
- 結果から、対照的学習は、視覚的強化学習における世界モデルの生成モデリングの代替手段として実用的かつよりロバストであることが裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。