Skip to main content
QUICK REVIEW

[논문 리뷰] XuanCe: A Comprehensive and Unified Deep Reinforcement Learning Library

Wenzhang Liu, Wenzhe Cai|arXiv (Cornell University)|2023. 12. 25.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

XuanCe는 PyTorch, TensorFlow, MindSpore를 지원하는 통합형 오픈소스 딥 강화학습 라이브러리로, 40개 이상의 단일 에이전트 및 다중 에이전트 DRL 알고리즘을 제공합니다. 이는 프레임워크 간 호환성, 모듈식 확장성, 그리고 MuJoCo, Atari, StarCraft II 환경에서의 고성능을 구현하며, 동일한 초모수 설정으로 벤치마크 작업에서 최신 기술 수준의 성능을 달성합니다.

ABSTRACT

In this paper, we present XuanCe, a comprehensive and unified deep reinforcement learning (DRL) library designed to be compatible with PyTorch, TensorFlow, and MindSpore. XuanCe offers a wide range of functionalities, including over 40 classical DRL and multi-agent DRL algorithms, with the flexibility to easily incorporate new algorithms and environments. It is a versatile DRL library that supports CPU, GPU, and Ascend, and can be executed on various operating systems such as Ubuntu, Windows, MacOS, and EulerOS. Extensive benchmarks conducted on popular environments including MuJoCo, Atari, and StarCraftII multi-agent challenge demonstrate the library's impressive performance. XuanCe is open-source and can be accessed at https://github.com/agi-brain/xuance.git.

연구 동기 및 목표

  • 다양한 딥러닝 프레임워크(PyTorch, TensorFlow, MindSpore)를 지원하고 다양한 RL 알고리즘을 통합한 확장 가능한 DRL 라이브러리의 부족을 보완하기 위해.
  • 다양한 DRL 및 MARL 알고리즘 간에 통일된 API와 모듈식 구성 요소를 제공함으로써 알고리즘의 재사용성과 확장성을 향상시키기 위해.
  • CPU, GPU, Ascend를 포함한 다양한 하드웨어와 Ubuntu, Windows, macOS, EulerOS를 포함한 다양한 운영 체제에서 일관된 성능을 제공함으로써 효율적인 훈련을 가능하게 하기 위해.
  • 복잡한 다중 에이전트 설정을 포함한 온폴리시 및 오프폴리시 알고리즘을 표준 벤치마크에서 표준화된 평가를 통해 지원하기 위해.
  • 사용자가 새로운 알고리즘과 환경을 쉽게 추가할 수 있도록 포괄적인 문서화와 확장성 지원을 제공하기 위해.

제안 방법

  • 초모수, 환경 설정, 모델 아키텍처를 관리하기 위해 YAML 기반의 구성 파일을 사용하여 영구적이고 탄력적인 설정을 가능하게 합니다.
  • 환경, 알고리즘, 공통 도구, 구성 요소를 분리한 모듈식 설계를 구현하여 코드 재사용성과 확장성을 향상시킵니다.
  • 통일된 API를 통해 기반 딥러닝 프레임워크를 추상화하여, 공통 인터페이스 계층을 통해 PyTorch, TensorFlow, MindSpore와의 원활한 통합을 가능하게 합니다.
  • 벡터화된 환경을 통해 병렬 환경 상호작용을 지원함으로써 샘플 효율성과 훈련 속도를 향상시킵니다. 특히 온폴리시 알고리즘에 있어 유의미한 개선을 이룹니다.
  • 다중 에이전트 작업을 위해 부분 관측 문제를 처리하기 위해 RNN 기반 표현(GRU)을 사용하고, 모델 복잡도를 줄이기 위해 파라미터 공유 기법을 적용합니다.
  • 표준화된 훈련 프로토콜과 평가 지표(예: 승리율, 누적 보상)를 사용하여 다수의 랜덤 시드를 기반으로 한 벤치마크를 수행함으로써 신뢰성 확보.

실험 결과

연구 질문

  • RQ1동일한 DRL 라이브러리가 다양한 딥러닝 프레임워크(PyTorch, TensorFlow, MindSpore)를 효과적으로 통합하면서도 높은 성능와 확장성을 유지할 수 있는가?
  • RQ2모듈식이고 구성 기반의 설계는 새로운 DRL 및 MARL 알고리즘의 빠른 프로토타이핑과 통합에 얼마나 효과적인가?
  • RQ3XuanCe가 MuJoCo, Atari, SMAC와 같은 표준 벤치마크에서 공개된 최신 기술 수준(SOTA) 결과와 비교해 유사한 성능을 달성할 수 있는가?
  • RQ4부분 관측 조건 하에서 다양한 협력적 및 경쟁적 상황을 고려한 다중 에이전트 훈련에 대해 라이브러리의 지원은 얼마나 효과적인가?
  • RQ5통일된 API와 모듈식 구성 요소는 새로운 알고리즘과 환경의 개발 및 통합 오버헤드를 크게 줄일 수 있는가?

주요 결과

  • XuanCe는 동일한 초모수와 네트워크 아키텍처 조건에서 Atari 환경에서 평균 인간 정규화 점수 4820.0 ± 2429.32를 기록하여, 공개된 DQN 및 PPO 결과를 초월하는 성능을 보였다.
  • MuJoCo 벤치마크에서 XuanCe는 평균 점수 5008.7 ± 1235를 기록하여 다수의 연속 제어 작업에서 뛰어난 성능를 입증하였다.
  • StarCraft II 다중 에이전트 도전 과제(SMAC)에서, IQL, VDN, QMIX, WQMIX, VDAC-mix, IPPO, MAPPO를 포함한 모든 테스트된 MARL 알고리즘은 복잡도가 다른 아홉 개의 맵에서 안정적이고 효과적인 학습 곡선을 보였다.
  • QMIX와 WQMIX를 사용하여 2m_vs_1z 맵에서 승리율이 90% 이상을 기록하여 협력적 다중 에이전트 설정에서 뛰어난 샘플 효율성과 일반화 능력을 입증하였다.
  • 벤치마크 결과는 동일한 네트워크 아키텍처와 초모수를 사용할 경우 XuanCe가 공개된 SOTA 결과와 높은 성능 일致성을 유지함을 확인하였다.
  • 라이브러리의 모듈식 설계와 통일된 API는 새로운 알고리즘과 환경의 통합을 원활하게 가능하게 하였으며, 40개 이상의 알고리즘과 여러 벤치마크 환경에 대한 지원 확장 사례를 통해 이를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.