Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Reinforcement Learning with Multi-Step Generative Models

Orr Krupnik, Igor Mordatch|arXiv (Cornell University)|Jan 29, 2019
Reinforcement Learning in Robotics参考文献 34被引用数 7
ひとこと要約

本論文は、分離可能なマルチステップ生成モデルを用いたマルチエージェント強化学習フレームワークを提案し、サンプル効率を向上させるとともに、連続的制御タスクにおける協調的および競合的行動の学習を可能にする。トラジェクトリーセグメントを分離可能な潜在空間でモデル化することで、エージェントの行動を独立して最適化可能となり、限られたデータでもモデルフリーのベースラインを上回る性能を発揮する。

ABSTRACT

We consider model-based reinforcement learning (MBRL) in 2-agent, high-fidelity continuous control problems -- an important domain for robots interacting with other agents in the same workspace. For non-trivial dynamical systems, MBRL typically suffers from accumulating errors. Several recent studies have addressed this problem by learning latent variable models for trajectory segments and optimizing over behavior in the latent space. In this work, we investigate whether this approach can be extended to 2-agent competitive and cooperative settings. The fundamental challenge is how to learn models that capture interactions between agents, yet are disentangled to allow for optimization of each agent behavior separately. We propose such models based on a disentangled variational auto-encoder, and demonstrate our approach on a simulated 2-robot manipulation task, where one robot can either help or distract the other. We show that our approach has better sample efficiency than a strong model-free RL baseline, and can learn both cooperative and adversarial behavior from the same data.

研究の動機と目的

  • マルチエージェント連続的制御問題におけるモデルベース強化学習(MBRL)の誤差蓄積問題に対処すること。
  • エージェント間の相互作用を捉えつつ、各エージェントの行動を別々に最適化可能にする生成モデルの開発。
  • 協調的または競合的データの混合データセット上で学習された1つのマルチステップ生成モデルが、協調的および敵対的ポリシー学習を両立できることの実証。
  • 高精細ロボット操作タスクにおいて、モデルフリーRLベースラインと比較してサンプル効率を向上させること。

提案手法

  • 2エージェントのマルチステップトラジェクトリーセグメントをモデル化するための、分離可能な変分オートエンコーダ(VAE)を用いて、結合潜在空間を学習する。
  • 初期状態と行動を入力として、将来のトラジェクトリーセグメントを予測するための条件付きVAEを用い、潜在空間が各エージェントの「戦略空間」を符号化する。
  • 潜在変数同士の分離性を保証するため、相互情報量の変分下界を用いて、2エージェントの潜在変数間の分離を強制する。
  • モデル予測制御(MPC)を用いて潜在空間内でトラジェクトリーオプティマイゼーションを実行し、環境で実行する最初の行動セグメントを選択する。
  • 協調的および競合的シナリオの両方のデータを統合的に学習することで、タスク間で共有されるモデル学習を可能にする。
  • 推論時に報酬の再重み付けを施すことにより、同じデータセットから協調的および敵対的行動学習を両立可能にする。

実験結果

リサーチクエスチョン

  • RQ1マルチステップ生成モデルを2エージェント連続的制御タスクに拡張可能か? その際、エージェント間の分離性を維持できるか?
  • RQ2潜在空間にエージェント間の相互作用を捉えつつ、各エージェントの行動を独立して最適化可能にするにはどうすればよいか?
  • RQ3協調的および競合的データの混合データセット上で学習された1つのモデルが、協調的および敵対的ポリシー学習を両立できるか?
  • RQ4提案手法は、モデルフリーRLのベースラインと比較して、マルチエージェント設定でより高いサンプル効率を達成できるか?
  • RQ5分離可能な潜在表現は、マルチエージェント環境における戦略的行動を効果的に符号化できるか?

主な発見

  • 提案されたMBRL手法は、協調的および競合的2ロボット操作タスクの両方で、MFRLベースライン(MADDPG)を上回り、平均報酬が高かった。
  • 訓練ステップが650kにとどまる状況でも、協調的タスクで平均報酬-0.72 ± 0.44を達成したのに対し、MADDPGは-1.79 ± 0.76を記録した。
  • 競合的タスクにおいて、協調的データで学習したMBRLモデル(co-op)は「keep」タスクで7.77 ± 3.12のスコアを達成し、MADDPGベースラインの6.43 ± 3.97を上回った。
  • 競合的データで学習したMBRLモデル(comp)は、「keep」タスクで8.26 ± 2.81のスコアを記録し、MADDPGベースラインを著しく上回った。
  • 本手法はサンプル効率が向上しており、少ないデータで学習した場合でも明確な性能優位性を示した。
  • 生成されたトラジェクトリの可視化から、潜在空間が明確に異なる戦略を符号化していることが確認され、潜在空間が戦略空間として解釈可能であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。