Skip to main content
QUICK REVIEW

[論文レビュー] XuanCe: A Comprehensive and Unified Deep Reinforcement Learning Library

Wenzhang Liu, Wenzhe Cai|arXiv (Cornell University)|Dec 25, 2023
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

XuanCeは、PyTorch、TensorFlow、MindSporeをサポートする統合的でオープンソースの深層強化学習(DRL)ライブラリであり、40以上の単一エージェントおよびマルチエージェントDRLアルゴリズムを備えています。異なるフレームワーク間の互換性、モジュラーな拡張性、およびMuJoCo、Atari、StarCraft IIの環境における高いパフォーマンスを実現し、一貫したハイパーパrameter設定のもとでベンチマークタスクで最先端の結果を達成しています。

ABSTRACT

In this paper, we present XuanCe, a comprehensive and unified deep reinforcement learning (DRL) library designed to be compatible with PyTorch, TensorFlow, and MindSpore. XuanCe offers a wide range of functionalities, including over 40 classical DRL and multi-agent DRL algorithms, with the flexibility to easily incorporate new algorithms and environments. It is a versatile DRL library that supports CPU, GPU, and Ascend, and can be executed on various operating systems such as Ubuntu, Windows, MacOS, and EulerOS. Extensive benchmarks conducted on popular environments including MuJoCo, Atari, and StarCraftII multi-agent challenge demonstrate the library's impressive performance. XuanCe is open-source and can be accessed at https://github.com/agi-brain/xuance.git.

研究の動機と目的

  • 複数のディープラーニングフレームワーク(PyTorch、TensorFlow、MindSpore)をサポートし、多様なRLアルゴリズムを統合した拡張性のあるDRLライブラリの不足を解消すること。
  • 異なるDRLおよびマルチエージェントRL(MARL)アルゴリズム間で一貫したAPIとモジュラーなコンponentsを提供することで、アルゴリズムの再利用性と拡張性を向上させること。
  • CPU、GPU、Ascendを含む多様なハードウェアおよびUbuntu、Windows、macOS、EulerOSを含む複数のオペレーティングシステムで、一貫したパフォーマンスを発揮する効率的なトレーニングを可能にすること。
  • オンポリシーおよびオフポリシーの両方のアルゴリズム、特に部分観測可能な複雑なマルチエージェント設定を標準化された評価プロトコルでサポートすること。
  • ユーザーが新しいアルゴリズムや環境を簡単に追加できるように、包括的なドキュメンテーションと拡張性のサポートを提供すること。

提案手法

  • ハイパーパramータ、環境設定、モデルアーキテクチャを管理するためのYAMLベースの設定ファイルを採用し、柔軟で再現性のあるセットアップを実現。
  • 環境、アルゴリズム、共通ツール、設定の各コンponentを分離したモジュラー設計を実装し、コードの再利用性と拡張性を向上。
  • 統一されたAPIにより、下位のディープラーニングフレームワーク(PyTorch、TensorFlow、MindSpore)を抽象化し、共通インターフェース層を通じてシームレスな統合を実現。
  • ベクトル化された環境を活用した並列環境インタラクションにより、特にオンポリシーアルゴリズムにおいて、サンプル効率とトレーニング速度を向上。
  • マルチエージェントタスクでは、部分観測性に対応するためRNNベースの表現(GRU)を採用し、モデルの複雑さを低減するためパラメータ共有を適用。
  • 標準化されたトレーニングプロトコルと評価指標(例:勝率、累積報酬)を用いて複数のランダムシードでベンチマークを実施し、信頼性を確保。

実験結果

リサーチクエスチョン

  • RQ11つのDRLライブラリが、PyTorch、TensorFlow、MindSporeといった多様なディープラーニングフレームワークを統合的にサポートしながら、高いパフォーマンスと拡張性を維持できるか。
  • RQ2モジュラーかつ設定駆動の設計は、新しいDRLおよびMARLアルゴリズムの迅速なプロトタイピングと統合をどの程度効果的に可能にするか。
  • RQ3XuanCeは、MuJoCo、Atari、SMACといった標準ベンチマークで、発表済みのSOTA結果と同等のパフォーマンスを達成できるか。
  • RQ4部分観測性を伴う多様な協調的および競合的シナリオにおけるマルチエージェントトレーニングにおいて、このライブラリのサポートはどの程度効果的か。
  • RQ5統一されたAPIとモジュラーコンponentsにより、新しいアルゴリズムや環境の開発および統合のオーバーヘッドを顕著に低減できるか。

主な発見

  • Atari環境において、XuanCeは、同一のハイパーパramータとネットワーク構造のもとで、DQNおよびPPOの発表済み結果を上回る平均人間正規化スコア4820.0 ± 2429.32を達成。
  • MuJoCoベンチマークでは、平均スコア5008.7 ± 1235を達成し、複数の連続制御タスクで優れたパフォーマンスを示した。
  • StarCraft IIマルチエージェントチャレンジ(SMAC)では、IQL、VDN、QMIX、WQMIX、VDAC-mix、IPPO、MAPPOを含むすべてのテスト済みMARLアルゴリズムが、複雑さの異なる9つのマップで安定的かつ効果的な学習曲線を示した。
  • QMIXおよびWQMIXを用いた2m_vs_1zマップでは、90%を超える勝率を達成し、協調的マルチエージェント設定における優れたサンプル効率と一般化性能を示した。
  • ベンチマーク結果から、同一のネットワークアーキテクチャとハイパーパramータを使用した場合、XuanCeが発表済みのSOTA結果と高いパフォーマンスの一貫性を維持していることが確認された。
  • ライブラリのモジュラー設計と統一されたAPIにより、新しいアルゴリズムや環境の統合がシームレスに実現され、40以上のアルゴリズムおよび複数のベンチマーク環境へのサポート拡張が成功裏に実施された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。