Skip to main content
QUICK REVIEW

[論文レビュー] Variational Automatic Curriculum Learning for Sparse-Reward Cooperative Multi-Agent Problems

Jiayu Chen, Yuanxin Zhang|arXiv (Cornell University)|Nov 8, 2021
Reinforcement Learning in Robotics参考文献 22被引用数 14
ひとこと要約

本稿では、スパarsity報酬を持つ協調的マルチエージェント強化学習のための、変分推論に基づくカリキュラム学習フレームワークであるVariational Automatic Curriculum Learning (VACL) を提案する。訓練目的関数をポリシー最適化とタスク分布更新に分解することで、VACLはタスク拡張とエージェント進行を用いて階層的訓練カリキュラムを自動生成し、100エージェントのシンプルスプレッドで98%のカバレッジを達成するとともに、1台のデスクトップマシンを用いても隠れんぼゲームにおけるラムプ利用といった複雑な行動を再現できる。

ABSTRACT

We introduce a curriculum learning algorithm, Variational Automatic Curriculum Learning (VACL), for solving challenging goal-conditioned cooperative multi-agent reinforcement learning problems. We motivate our paradigm through a variational perspective, where the learning objective can be decomposed into two terms: task learning on the current task distribution, and curriculum update to a new task distribution. Local optimization over the second term suggests that the curriculum should gradually expand the training tasks from easy to hard. Our VACL algorithm implements this variational paradigm with two practical components, task expansion and entity progression, which produces training curricula over both the task configurations as well as the number of entities in the task. Experiment results show that VACL solves a collection of sparse-reward problems with a large number of agents. Particularly, using a single desktop machine, VACL achieves 98% coverage rate with 100 agents in the simple-spread benchmark and reproduces the ramp-use behavior originally shown in OpenAI's hide-and-seek project. Our project website is at https://sites.google.com/view/vacl-neurips-2021.

研究の動機と目的

  • 大規模なエージェント数を伴うスパarsity報酬環境下での協調的マルチエージェントポリシーの学習という課題に対処すること。
  • 段階的にタスク難易度を適応的に変化させるスケーラブルで自動的なカリキュラム学習フレームワークの開発。
  • 変分推論を用いて、タスク設定とエージェント/オブジェクト数の両方の面でカリキュラム生成を統一すること。
  • 報酬の形状付けなしに、複雑なマルチエージェント環境でサンプル効率的かつ高性能な学習を可能にすること。
  • 1台のデスクトップマシンを用いても、隠れんぼゲームにおけるラムプ利用といったエメrgent行動を再現できること。

提案手法

  • マルチエージェント強化学習(MARL)の目的関数を変分推論問題として定式化し、ポリシー改善項とタスク分布更新項に分解する。
  • カリキュラム学習中にタスク分布を全タスク空間へと効率的に拡張するために、スティン変分勾配降下法(SVGD)を用いる。
  • エージェント数やオブジェクト数を段階的に増やす「エージェント進行」を導入し、より大きなシステムが学習に難易度が高いというインダクティブバイアスを活用する。
  • 離散変数(例:エージェント数)に対して連続的リラクゼーションを適用することで、エンド・トゥ・エンドで微分可能なカリキュラム学習を実現する。
  • ポリシー最適化と変分プロポーザル更新によるカリキュラム更新を交互に実行する二段階のトレーニングループを実装する。
  • 同種のエージェント間で共有されるゴール条件付きポリシーを採用し、PPOを用いたオフポリシー深層強化学習で訓練する。

実験結果

リサーチクエスチョン

  • RQ1変分推論フレームワークを用いて、協調的マルチエージェント強化学習(MARL)のための原理的カリキュラム学習アルゴリズムを導出可能か?
  • RQ2マルチエージェント環境において、タスク設定とエージェント数の両方の面でカリキュラム学習を自動的に生成可能か?
  • RQ3このようなカリキュラムが、スパarsity報酬・高次元マルチエージェント環境下でもサンプル効率的学習を可能にするか?
  • RQ4提案手法は、ラムプ利用のような複雑なエメrgent行動を協調的マルチエージェント環境で再現可能か?
  • RQ5本手法は、1台のデスクトップマシンとスパarsity報酬のみで100体以上のエージェントにスケーリング可能か?

主な発見

  • VACLは、スパarsity報酬と1台のデスクトップマシンのみを用いて、100エージェントのシンプルスプレッドベンチマークで98%のカバレッジ率を達成した。
  • 本手法は、OpenAIの隠れんぼプロジェクトで観察されたラムプ利用行動を成功裏に再現し、複雑な協調行動の出現を示した。
  • ロック・アンド・リターンチャレンジでは、90%を超える成功率を達成した。すべてのベースラインは同じトレーニング予算下で15%を上回らなかった。
  • MPEおよびMuJoCoベースの隠れんぼ環境の両方で、VACLはすべてのベースラインを大きく上回るトレーニング速度と最終的パフォーマンスを達成した。
  • タスク拡張とエージェント進行の組み合わせにより、手動カリキュラム設計なしに効果的な階層的カリキュラム学習が可能となった。
  • 離散変数の連続的リラクゼーションにより、エージェント数にわたるスムーズなカリキュラム学習が可能となり、異なるシステムサイズ間での統合的訓練が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。