Skip to main content
QUICK REVIEW

[論文レビュー] Continuous Coordination As a Realistic Scenario for Lifelong Learning

Hadi Nekoei, Akilesh Badrinaaraayanan|PolyPublie (École Polytechnique de Montréal)|Mar 4, 2021
Reinforcement Learning in Robotics参考文献 59被引用数 7
ひとこと要約

本論文は、継続的マルチエージェント協調をモデル化するための、協同カードゲーム『ハナビ』を用いた新しい生涯強化学習(Lifelong RL)ベンチマーク、Lifelong Hanabiを紹介する。異なるマルチエージェント強化学習(MARL)手法とシードで事前学習されたエージェント群からなる大規模な戦略プールから順次協調するエージェントを訓練することで、ゼロショット一般化を可能とし、生涯学習における重要なトレードオフを明らかにする。継続的学習により、さまざまなMARL手法間で協調性能が顕著に向上することが示された。

ABSTRACT

Current deep reinforcement learning (RL) algorithms are still highly task-specific and lack the ability to generalize to new environments. Lifelong learning (LLL), however, aims at solving multiple tasks sequentially by efficiently transferring and using knowledge between tasks. Despite a surge of interest in lifelong RL in recent years, the lack of a realistic testbed makes robust evaluation of LLL algorithms difficult. Multi-agent RL (MARL), on the other hand, can be seen as a natural scenario for lifelong RL due to its inherent non-stationarity, since the agents' policies change over time. In this work, we introduce a multi-agent lifelong learning testbed that supports both zero-shot and few-shot settings. Our setup is based on Hanabi -- a partially-observable, fully cooperative multi-agent game that has been shown to be challenging for zero-shot coordination. Its large strategy space makes it a desirable environment for lifelong RL tasks. We evaluate several recent MARL methods, and benchmark state-of-the-art LLL algorithms in limited memory and computation regimes to shed light on their strengths and weaknesses. This continual learning paradigm also provides us with a pragmatic way of going beyond centralized training which is the most commonly used training protocol in MARL. We empirically show that the agents trained in our setup are able to coordinate well with unseen agents, without any additional assumptions made by previous works. The code and all pre-trained models are available at https://github.com/chandar-lab/Lifelong-Hanabi.

研究の動機と目的

  • マルチエージェント設定における生涯強化学習(LLL)のための現実的で挑戦的なベンチマークの不足に対処すること。
  • 合成的な環境変化ではなく、多様なエージェント戦略を用いて非定常性をモデル化すること。
  • 未確認の、かつて出会ったことのない相手と協調しなければならない現実的な条件下でLLLアルゴリズムを評価すること。
  • 中央集権的トレーニングを越えて、継続的学習環境下で分散型・ゼロショット協調を可能にすること。
  • タスク類似度をクロスプレイスコアで定量化し、前向き/後向き転送を測定できるスケーラブルで再現可能なベンチマークを提供すること。

提案手法

  • Lifelong Hanabiは、ハナビ協同ゲームに基づいて構築されており、1つの学習エージェントが100体以上の異なるMARL手法とシードで事前学習されたエージェントプールと順次対戦する。
  • タスク類似度は、クロスプレイ(CP)行列を用いて定量化され、各エントリは2つのエージェントが一緒にプレイした際のスコアを表し、戦略的距離の代理指標として機能する。
  • 学習エージェントは、非定常な方策を持つ継続的学習をシミュレートするために、順次登場するパートナーエージェントのシーケンス上で訓練を受ける。
  • 評価には3つの設定が含まれる:単一プレイ(SP)、メソッド内CP(同じMARL手法)、メソッド間CP(異なるMARL手法)、ゼロショット協調を評価する。
  • 記憶容量と計算リソースの制限下で、経験再生(ER)、マルチタスク学習(MTL)、パラメータ隔離などの複数のLLLアルゴリズムを適用・比較する。
  • フレームワークにより、前向き転送(新しい相手に対するパフォーマンス)と後向き転送(過去の協調スキルの保持)の両方を評価でき、CPスコアで測定される。

実験結果

リサーチクエスチョン

  • RQ1継続的マルチエージェント環境で学習した生涯RLエージェントは、多様なMARL手法から得た未確認のエージェントと効果的なゼロショット協調を達成できるか?
  • RQ2現実的で戦略が多様なベンチマーク上で評価された場合、標準的なLLLアルゴリズムは後向きおよび前向き転送の観点でどのように性能を示すか?
  • RQ3個々のタスクで学習するのと比較して、継続的学習が異なるMARL手法間での一般化をどの程度向上させるか?
  • RQ4アーキテクチャ的およびトレーニングの仮定(例:対称性、補助タスク、事前学習)は、生涯学習環境下での一般化能力にどのように影響するか?
  • RQ5トレーニング中に遭遇するパートナーエージェントの順序が、ゼロショット設定下での最終協調パフォーマンスに影響を及えるか?

主な発見

  • Lifelong Hanabiで訓練されたエージェントは、初期方策と比較して、単一プレイ(SP)スコアが低くても、Inter-CPスコアの顕著な向上を示しており、未確認のエージェントとのゼロショット協調が向上していることを示している。
  • IQL+AUX+ER手法が、評価されたすべての手法の中で最高のInter-CPパフォーマンスを達成し、ゼロショット協調において、専用のMARLアルゴリズムでさえも上回った。
  • SOTA MARL手法はメソッド内CPおよびSPでは優れた性能を示すが、Inter-CPでは失敗しており、異なるトレーニングパラダイム間での一般化のギャップが顕在化している。
  • Adamを用いたMTLとSGDを用いたERが、最終的なInter-CPスコアで最高を記録しており、継続的学習下での強力な一般化能力を示しているが、MTLは全パートナーエージェントの同時アクセスを必要とし、現実世界への適用性に制限がある。
  • フレームワークにより、新しい相手への適応と、過去の協調スキルの保持の間には明確なトレードオフが存在することが明らかになった。これは、生涯マルチエージェント学習における安定性と柔軟性のジレンマを示している。
  • 本研究は、中央集権的トレーニングや追加仮定を必要とせず、継続的学習により効果的なゼロショット協調が可能であることを示しており、ベンチマークの現実的で実用的な価値を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。