Skip to main content
QUICK REVIEW

[論文レビュー] Meta Automatic Curriculum Learning

Rémy Portelas, Clément Romac|arXiv (Cornell University)|Nov 16, 2020
Intelligent Tutoring Systems and Adaptive Learning参考文献 49被引用数 5
ひとこと要約

本論文は、以前に訓練されたエージェントの履歴学習データを活用することで、多様な強化学習(RL)エージェントにわたってカリキュラム生成を一般化できる、Meta Automatic Curriculum Learning(Meta-ACL)というフレームワークを紹介する。能力ベクトルのマッチングを用いてカリキュラムの事前知識を転送することで、提案手法AGAINは、パラメトリックパーカーなどの複雑な手順的環境において、古典的なACLを著しく上回り、困難な設定でもほぼオラクル性能に近い結果を達成した。

ABSTRACT

A major challenge in the Deep RL (DRL) community is to train agents able to generalize their control policy over situations never seen in training. Training on diverse tasks has been identified as a key ingredient for good generalization, which pushed researchers towards using rich procedural task generation systems controlled through complex continuous parameter spaces. In such complex task spaces, it is essential to rely on some form of Automatic Curriculum Learning (ACL) to adapt the task sampling distribution to a given learning agent, instead of randomly sampling tasks, as many could end up being either trivial or unfeasible. Since it is hard to get prior knowledge on such task spaces, many ACL algorithms explore the task space to detect progress niches over time, a costly tabula-rasa process that needs to be performed for each new learning agents, although they might have similarities in their capabilities profiles. To address this limitation, we introduce the concept of Meta-ACL, and formalize it in the context of black-box RL learners, i.e. algorithms seeking to generalize curriculum generation to an (unknown) distribution of learners. In this work, we present AGAIN, a first instantiation of Meta-ACL, and showcase its benefits for curriculum generation over classical ACL in multiple simulated environments including procedurally generated parkour environments with learners of varying morphologies. Videos and code are available at https://sites.google.com/view/meta-acl .

研究の動機と目的

  • 大規模で連続的なタスク空間において、複数のRLエージェントを訓練する際の、タブラ・ラサ型Automatic Curriculum Learning(ACL)の非効率性を是正すること。
  • エキスパート知識や高コストなタスク探索に依存することを減らすために、以前に訓練されたエージェントからの知識を再利用すること。
  • 1つの教師が未知の学習者群に適合したカリキュラムを生成するという、新たな学習パラダイム「Classroom Teaching(CT)」を形式化すること。
  • 異なる能力を持つエージェントにわたってACLアルゴリズムが一般化できるメタラーニングアプローチを開発すること。
  • 過去の訓練走行から得たカリキュラム事前知識を転送することで、マルチタスクで手続き的なRL環境におけるサンプル効率と最終的パフォーマンスを向上させること。

提案手法

  • 本手法は、ブラックボックス型RL学習者群の分布にわたってカリキュラム生成を一般化するフレームワークとしてMeta-ACLを形式化する。
  • AGAINは、Meta-ACLの最初の実装形であり、事前テストから抽出した能力ベクトルを用いて、新しいエージェントを過去に効果的であったカリキュラム事前知識にマッチングする。
  • 能力ベクトルは、全訓練開始前の多様なタスクの集合に対して各エージェントが示すパフォーマンスから計算される。
  • 過去のエージェントから得た高パフォーマンスなカリキュラム戦略を再利用し、能力ベクトルの類似度に基づいて最も類似した事前知識を選択する。
  • 古典的なACL(例:ALP-GMM)と、過去の訓練データからのインダクティブバイアスを組み合わせることで、収束速度の向上とより良い一般化性能を実現する。
  • 再訓練からスクラッチでの学習とファインチューニングの両方をサポートし、アブレーションスタディにより、ランダムまたは固定戦略に比べてカリキュラム転送の利点が示された。

実験結果

リサーチクエスチョン

  • RQ1能力や形状が異なる複数のRLエージェントにわたって、教師エージェントがカリキュラム生成を一般化できるか?
  • RQ2以前に訓練されたエージェントからのカリキュラム事前知識を再利用することで、タブラ・ラサ型ACLに比べてサンプル効率と最終的パフォーマンスが向上するか?
  • RQ3パラメトリックパーカーなどの複雑で手続き的な環境において、Meta-ACLはどの程度の性能を示すか?
  • RQ4再訓練からスクラッチでの学習とファインチューニングの両方の訓練レジームにおいて、Meta-ACLのパフォーマンス向上は一貫しているか?
  • RQ5Meta-ACLは、エキスパート知識や広範なタスク空間探索への依存度をどの程度低減できるか?

主な発見

  • ショートBipedalWalker環境では、AGAIN-Rの平均パフォーマンスは19.0 ± 12.0であったが、これはオラクル(20.1 ± 3.4、p = 0.6)と有意差がなく、ほぼ最適な性能を示した。
  • AGAIN-Pは、デフォルトのBipedalWalker環境で平均44.3 ± 3.5の最高パフォーマンスを記録し、ALP-GMM(38.6 ± 3.5、p < 0.05)を著しく上回った。
  • すべてのバリアントにおいて、スクラッチからの再訓練がファインチューニングよりも一貫して高い最終パフォーマンスを達成した。これは、この設定において勾配ベースの転移学習の脆さを示している。
  • デフォルトのWalker実験では、ALP-GMMとINを組み合わせた第二回目の走行は悪影響を及ぼしたが、ショートWalkerタスクでは不可欠であり、AGAIN-Rが他のすべてのバリアントを上回ることを可能にした。
  • IN-Pバリアント(過去の訓練からのインダクティブバイアスのみを用いる)は、デフォルトのWalkerタスクで最高のパフォーマンスを達成し、カリキュラム事前知識そのものが非常に効果的である可能性を示唆した。
  • 最も挑戦的なショートWalker設定では、AGAIN-Rの平均パフォーマンスは19.0であったが、これはALP-GMM(10.2 ± 11.5)や他のベースラインを著しく上回り、メタラーニングされたカリキュラム転送の価値を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。