Skip to main content
QUICK REVIEW

[論文レビュー] Deep Latent Competition: Learning to Race Using Visual Control Policies in Latent Space

Wilko Schwarting, Tim Seyde|arXiv (Cornell University)|Feb 19, 2021
Reinforcement Learning in Robotics被引用数 10
ひとこと要約

Deep Latent Competition (DLC) は、学習済みの潜在空間における想像上の自己対戦を通じて、競争的な視覚制御方策を学ぶモデルベースのマルチエージェント強化学習アルゴリズムである。共同遷移関数と相手エージェントの視点予測を組み合わせることで、生の画像観測からスケーラブルで一貫性のあるマルチエージェント計画を可能にし、想像における相手の行動を考慮しないベースラインと比較して優れたレース性能を達成する。

ABSTRACT

Learning competitive behaviors in multi-agent settings such as racing requires long-term reasoning about potential adversarial interactions. This paper presents Deep Latent Competition (DLC), a novel reinforcement learning algorithm that learns competitive visual control policies through self-play in imagination. The DLC agent imagines multi-agent interaction sequences in the compact latent space of a learned world model that combines a joint transition function with opponent viewpoint prediction. Imagined self-play reduces costly sample generation in the real world, while the latent representation enables planning to scale gracefully with observation dimensionality. We demonstrate the effectiveness of our algorithm in learning competitive behaviors on a novel multi-agent racing benchmark that requires planning from image observations. Code and videos available at https://sites.google.com/view/deep-latent-competition.

研究の動機と目的

  • 部分観測性と高次元の画像入力を持つマルチエージェント環境において、競争的で高速なドライブ行動を学ぶ課題に対処すること。
  • 学習済みの世界モデルにおける想像上の自己対戦に実世界のロールアウトを置き換えることで、視覚制御方策の効率的訓練を可能にすること。
  • エゴ観測から相手の視点を予測することで、相手行動の推論を向上させること。
  • 部分観測下においても長時間スパンの計画を可能にする、スケーラブルで一貫性のある潜在世界モデルの開発。
  • 新規の連続制御レースベンチマークにおいて、共同ダイナミクスと信念推定を伴う想像上の自己対戦の有効性を実証すること。

提案手法

  • 変分自己オートエンコーダを用いて、画像観測をコンactな潜在空間に符号化することで、マルチエージェント世界モデルを学習する。
  • 両エージェントの潜在状態を同時に伝播する共同遷移関数を採用し、想像された軌道の整合性を保証する。
  • エゴエージェントの視点から相手の視覚的観測を予測する別個のデコーダーヘッドを導入し、信念推定を可能にする。
  • 学習済みの世界モデルを用いて、自己対戦の訓練のための長時間スパンの想像ロールアウトを生成し、想像された軌道を介して方策勾配を逆伝播する。
  • 想像されたゲーム結果を用いた解析的勾配更新により方策を最適化し、訓練中は実世界環境との相互作用を回避する。
  • 再構成損失、予測損失、方策勾配損失の組み合わせを用いて、エンドツーエンドでエージェントを訓練する。

実験結果

リサーチクエスチョン

  • RQ1学習済みの潜在空間における想像上の自己対戦は、実世界のロールアウトなしに、競争的な視覚制御方策の有効な訓練を可能にするか?
  • RQ2片方のエージェントしか相手を観測しない状況において、共同世界モデルがマルチエージェント予測の整合性をどれほど維持できるか?
  • RQ3エゴエージェントの視点から相手の視点を予測することで、競争的レースにおける方策性能が向上するか?
  • RQ4高次元の画像観測に対しても、潜在空間の世界モデルは計画の正確性を維持しながらスケーラブルに拡張可能か?
  • RQ5共同ダイナミクスを伴う想像上の自己対戦は、エージェント状態を別々に伝播する手法と比較して、方策性能にどのように影響するか?

主な発見

  • DLCエージェントは、想像における相手の行動を考慮しないベースラインと比較して、優れたレース性能を達成しており、共同計画の価値を示している。
  • 想像された軌道では、25ステップにわたり両エージェントの視点が一貫して予測されており、トラックの特徴や相対的位置関係が正確に保持されている。
  • モデルは観測可能な相手を正確に再構成し、観測されていない場合でも合理的に行動を予測しており、ノイズのみの出力を避ける。
  • 共同遷移関数により、予測がエージェント間で一貫性を保ち、行動の影響の信頼性ある推定が可能になる。
  • エージェントは想像されたシーケンスにおいて、相手をコース外に追い出すことで先行を図る戦略的思考を学習している。
  • 特権情報(状態リストや地図など)を一切使用せず、生の画像観測からの有効な訓練が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。