Skip to main content
QUICK REVIEW

[論文レビュー] TeachMyAgent: a Benchmark for Automatic Curriculum Learning in Deep RL

Clément Romac, Rémy Portelas|arXiv (Cornell University)|Mar 17, 2021
Reinforcement Learning in Robotics参考文献 60被引用数 4
ひとこと要約

本論文では、深層強化学習における自動カリキュラム学習(ACL)のベンチマークであるTeachMyAgentを紹介する。プロシージャルな環境として、Box2Dベースの二足歩行ロボットと、複雑なパークール環境を含む。複数のACLアルゴリズムを評価した結果、ALP-GMMとCovar-GMMがランダムなタスク選択を著しく上回る性能を示したが、パークール環境は現在の手法にとって依然として挑戦的な未解決問題のままである。

ABSTRACT

Training autonomous agents able to generalize to multiple tasks is a key target of Deep Reinforcement Learning (DRL) research. In parallel to improving DRL algorithms themselves, Automatic Curriculum Learning (ACL) study how teacher algorithms can train DRL agents more efficiently by adapting task selection to their evolving abilities. While multiple standard benchmarks exist to compare DRL agents, there is currently no such thing for ACL algorithms. Thus, comparing existing approaches is difficult, as too many experimental parameters differ from paper to paper. In this work, we identify several key challenges faced by ACL algorithms. Based on these, we present TeachMyAgent (TA), a benchmark of current ACL algorithms leveraging procedural task generation. It includes 1) challenge-specific unit-tests using variants of a procedural Box2D bipedal walker environment, and 2) a new procedural Parkour environment combining most ACL challenges, making it ideal for global performance assessment. We then use TeachMyAgent to conduct a comparative study of representative existing approaches, showcasing the competitiveness of some ACL algorithms that do not use expert knowledge. We also show that the Parkour environment remains an open problem. We open-source our environments, all studied ACL algorithms (collected from open-source code or re-implemented), and DRL students in a Python package available at https://github.com/flowersteam/TeachMyAgent.

研究の動機と目的

  • 深層強化学習(DRL)における自動カリキュラム学習(ACL)アルゴリズムを評価するための標準化されたベンチマークの欠如に対処すること。
  • アルゴリズムの比較と進展を妨げる、タスク空間の複雑さ、実行可能性、一般化性といったACLの主な課題を特定すること。
  • 公平で再現可能かつスケーラブルなACL手法の評価を可能にする、プロシージャルなタスク生成を統合した統一ベンチマークの開発。
  • さまざまなDRL学生モデルとタスクの形状において、既存のACLアルゴリズムを評価し、性能の格差と限界を明らかにすること。
  • 環境、アルゴリズム、DRL学生をオープンソース化して、研究の加速とコミュニティ全体での比較を促進すること。

提案手法

  • 2つのプロシージャルな環境(Box2Dベースの二足歩行ロボットと、複数のACLの課題を統合した新しいパークール環境)を備えたベンチマークを設計。
  • 直接比較が可能な8つの代表的ACLアルゴリズム(ALP-GMM、Covar-GMM、GoalGAN、RIAC、SPDL、Setter-Solver、ADR、Random)を実装。
  • CPPNsを用いたプロシージャルコンテンツ生成(PCG)により、多様でスケーラブルで挑戦的なタスク空間を生成。
  • すべてのACL手法を、3つのDRL学生の形状(二足歩行ロボット、フィッシュ、クローラー)と、各設定で16個のランダムシードを用いて評価し、統計的妥当性を確保。
  • 定期的な間隔でウェルチのt検定を適用し、ACL手法とランダムベースラインとの間に有意な性能差があるかを同定。
  • すべての環境、アルゴリズム、DRLモデルを、https://github.com/flowersteam/TeachMyAgent にてPythonパッケージとしてオープンソース化。

実験結果

リサーチクエスチョン

  • RQ1標準化されたベンチマークは、深層強化学習におけるACLアルゴリズムの評価の比較可能性と再現可能性を向上させることができるか?
  • RQ2多様なDRL学生アーキテクチャとタスクの形状において、どのACLアルゴリズムが最も優れた性能を示すか?
  • RQ3エキスパート知識が不要なACL手法は、複雑なプロシージャル環境において、ランダムなタスク選択をどの程度上回るか?
  • RQ4なぜ現在のACL手法は、パークール環境における複雑な移動タスク(クローリング)を習得できないのか?
  • RQ5タスク空間を単純化することで、既存のACLアルゴリズムの真の潜在的性能が明らかになるか?

主な発見

  • ALP-GMMは、すべての形状でランダムなタスク選択を著しく上回り、二足歩行ロボットでは42.7%のタスクを習得し、パークール環境全体で26.4%の習得率を示した。
  • Covar-GMMとRIACはALP-GMMに近く、それぞれ二足歩行ロボットで35.7%、31.2%の習得率を示し、優れた一般化性能を示した。
  • SPDLとSetter-Solverはランダムと同等の性能を示し、それぞれ二足歩行ロボットで30.6%、28.75%の習得率を示し、ランダムを著しく上回らなかった。
  • ADRは早期に性能のピークに達し、二足歩行ロボットでは14.7%の習得率にとどまり、一部のシナリオではランダムよりも著しく劣った。
  • 水のない簡素化されたタスク空間では、ランダムな教師が6%のタスク(最良のシードでは最大30%)を習得していたことから、現在のACL手法が複雑な環境における実行可能な部分空間を発見できていないことが示唆された。
  • パークール環境は依然として未解決の課題であり、どのACL手法もクローリングの形状で1%を超える習得率を達成できず、現在のカリキュラム発見の限界が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。