Skip to main content
QUICK REVIEW

[論文レビュー] It Takes Four to Tango: Multiagent Selfplay for Automatic Curriculum Generation

Yuqing Du, Pieter Abbeel|arXiv (Cornell University)|Feb 22, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、対称的なマルチエージェント自己学習フレームワークとして、2つのオフポリシー学生と2つのレジーット最大化型ゴール生成器を用いて、多様で段階的に難易度が上がる、繰り返し再訪問されるゴールを自動で生成する、Curriculum Self Play (CuSP) を提案する。CuSP はミニマックスレジーット最適化によって探索と悪化記憶の防止のバランスを図ることで、分布外のゴールに対するゼロショット一般化性能が従来手法を上回る。

ABSTRACT

We are interested in training general-purpose reinforcement learning agents that can solve a wide variety of goals. Training such agents efficiently requires automatic generation of a goal curriculum. This is challenging as it requires (a) exploring goals of increasing difficulty, while ensuring that the agent (b) is exposed to a diverse set of goals in a sample efficient manner and (c) does not catastrophically forget previously solved goals. We propose Curriculum Self Play (CuSP), an automated goal generation framework that seeks to satisfy these desiderata by virtue of a multi-player game with four agents. We extend the asymmetric curricula learning in PAIRED (Dennis et al., 2020) to a symmetrized game that carefully balances cooperation and competition between two off-policy student learners and two regret-maximizing teachers. CuSP additionally introduces entropic goal coverage and accounts for the non-stationary nature of the students, allowing us to automatically induce a curriculum that balances progressive exploration with anti-catastrophic exploitation. We demonstrate that our method succeeds at generating an effective curricula of goals for a range of control tasks, outperforming other methods at zero-shot test-time generalization to novel out-of-distribution goals.

研究の動機と目的

  • 幅広いタスクを解ける汎用的強化学習エージェントを効率的に訓練するという課題に対処すること。
  • 段階的な難易度と多様性をバランスさせつつ、悪化記憶を防ぐ自動カリキュラムのゴール生成を実現すること。
  • 教師分類器に依存するか、非対称自己学習におけるサンプル非効率性といった従来手法の限界を、対称化されたマルチエージェントフレームワークを導入することで克服すること。
  • エージェントの学習進行に応じて動的に適応する、サンプル効率的でスケーラブルなカリキュラム生成を可能にすること。
  • 二重で非対称なゴール生成器を用いて、ゴール生成において協調(スキャフォールディング)と競争(チャレンジ)の両方を統合すること。

提案手法

  • CuSP は、2つのオフポリシーのゴール条件付き学生(アリスとボブ)と、それぞれに対応する2つのレジーット最大化型ゴール生成器(G_A と G_B)を有する対称的4エージェント構成を採用する。
  • 各ゴール生成器はミニマックスレジーット目的関数により最適化される:G_A はアリスとボブの報酬差(R^A - R^B)によって報酬を受け、ボブにとって挑戦的でアリスにとっては達成可能なゴールを提案するよう励ます。
  • この設計により動的バランスが実現される:G_A はボブのための段階的難易度の向上を促進すると同時に、アリスの学習を支援する。逆に G_B も同様の効果を発揮し、多様性と達成可能性の両立が保証される。
  • エージェントのポリシーの非定常性を明示的に扱い、忘却を防ぐためにエントロピー正則化を組み込む。
  • 学生は教師が生成するゴールから学び、教師は相対的パフォーマンスに基づいて適応する自己学習ループを実行することで、自律的なカリキュラム進行が可能になる。
  • ゴール生成は事前に指定されたゴール空間内に制限されるため、人間の事前知識を統合して安全性と妥当性を保証できる。

実験結果

リサーチクエスチョン

  • RQ1対称的マルチエージェント自己学習フレームワークは、ゴール条件付き強化学習における段階的難易度とゴール多様性のバランスを効果的に生成できるか?
  • RQ2自己学習を非ゼロサム設定に拡張することで、カリキュラム生成において協調と競争の両方を同時に支援できるか?
  • RQ3ミニマックスレジーットベースのゴール生成は、サンプル効率を維持しつつ、悪化記憶をどれほど緩和できるか?
  • RQ4分布外のゴールに対するゼロショット一般化において、CuSP は Asymmetric Self-Play (ASP) や GAN ベースのゴール生成といった従来手法と比べてどのように差をつけるか?
  • RQ5CuSP フレームワークにおける複数エージェントの相互作用から、どのような自己組織的行動やスキルが出現するか?

主な発見

  • CuSP は、複数の制御環境において、分布外のゴールに対するゼロショット一般化性能がベースライン手法を上回り、優れた一般化能力を示した。
  • 以前に解決済みのゴールに対するパフォーマンスが維持されていることから、継続的な再訪問と動的カリキュラム調整により、悪化記憶が効果的に緩和されていることが示された。
  • CuSP は多様で段階的に難易度が上がるカリキュラムを生成しており、エントロピー正則化と対称的教師ダイナミクスのおかげでゴール空間カバレッジが向上した。
  • 明示的な形状付けなしに、タスク固有のスキルが出現しており、自己学習ダイナミクスが複雑な行動発見を支援していることが示唆された。
  • 実験的結果から、CuSP は ASP や他のカリキュラム学習ベースラインと比較して、より高いサンプル効率と未学習ゴールにおける優れたパフォーマンスを達成した。
  • アブレーションスタディの結果、対称的設計とレジーットベース目的関数の両方が性能に不可欠であり、いずれかを除去すると著しく性能が低下することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。