Skip to main content
QUICK REVIEW

[논문 리뷰] Dealing With Non-stationarity in Decentralized Cooperative Multi-Agent Deep Reinforcement Learning via Multi-Timescale Learning

Hadi Nekoei, Akilesh Badrinaaraayanan|arXiv (Cornell University)|2023. 02. 06.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 비정합성 문제를 해결하기 위해 분산형 협동 다에이전트 강화학습(MARL)을 위한 다중 시간스케일 학습 알고리즘을 제안한다. 동시 정책 업데이트로 인한 비정상성 문제를 해결하기 위해 주요 에이전트는 빠르게, 다른 에이전트는 느리게 업데이트하는 방식으로 동시에 다양한 속도로 학습을 허용함으로써 학습 속도를 높이고 정책 이탈을 줄인다. 이 방법은 ePymarl 벤치마크에서 최신의 분산형 MARL 방법들을 능가한다.

ABSTRACT

Decentralized cooperative multi-agent deep reinforcement learning (MARL) can be a versatile learning framework, particularly in scenarios where centralized training is either not possible or not practical. One of the critical challenges in decentralized deep MARL is the non-stationarity of the learning environment when multiple agents are learning concurrently. A commonly used and efficient scheme for decentralized MARL is independent learning in which agents concurrently update their policies independently of each other. We first show that independent learning does not always converge, while sequential learning where agents update their policies one after another in a sequence is guaranteed to converge to an agent-by-agent optimal solution. In sequential learning, when one agent updates its policy, all other agent's policies are kept fixed, alleviating the challenge of non-stationarity due to simultaneous updates in other agents' policies. However, it can be slow because only one agent is learning at any time. Therefore it might also not always be practical. In this work, we propose a decentralized cooperative MARL algorithm based on multi-timescale learning. In multi-timescale learning, all agents learn simultaneously, but at different learning rates. In our proposed method, when one agent updates its policy, other agents are allowed to update their policies as well, but at a slower rate. This speeds up sequential learning, while also minimizing non-stationarity caused by other agents updating concurrently. Multi-timescale learning outperforms state-of-the-art decentralized learning methods on a set of challenging multi-agent cooperative tasks in the epymarl(Papoudakis et al., 2020) benchmark. This can be seen as a first step towards more general decentralized cooperative deep MARL methods based on multi-timescale learning.

연구 동기 및 목표

  • 분산형 협동 다에이전트 강화학습(MARL)에서 동시 정책 업데이트로 인한 비정상성 문제를 해결하기 위해.
  • 수렴 보장을 갖지 못하는 독립 학습의 한계와 단일 에이전트 업데이트로 인한 느린 속도를 가진 순차적 학습의 한계를 극복하기 위해.
  • 다른 에이전트의 업데이트 영향을 최소화하면서도 에이전트 간 동시 학습을 가능하게 하는 분산형 MARL 알고리즘을 설계하기 위해.
  • 중앙 집중적 훈련이나 조율 없이도 협동 MARL 환경에서 학습 효율성과 성능을 향상시키기 위해.
  • 다중 시간스케일 학습이 확장 가능하고 분산형 MARL에 효과적인 접근법임을 입증하기 위해.

제안 방법

  • 에이전트들이 동시에 업데이트되지만 다른 학습 속도를 갖는 다중 시간스케일 학습 프레임워크를 활용한다.
  • 주요 에이전트는 빠른 학습 속도를 사용하고, 다른 에이전트는 느린 학습 속도를 사용하여 주요 에이전트에 대한 정책 변화의 영향을 줄인다.
  • 이 설계는 순차적 학습보다 빠른 수렴을 가능하게 하면서도 동시 업데이트로 인한 비정상성의 영향을 최소화하여 안정성을 유지한다.
  • 알고리즘은 완전히 분산되어 있어 훈련 중 중앙 집중적 조율이나 공유 파라미터 업데이트가 필요하지 않다.
  • 학습 속도는 각 에이전트별로 명시적으로 스케줄링되며, 독립적인 딥 Q네트워크(DQN) 또는 정책 그래디언트 방법을 사용하여 구현된다.
  • 이 방법은 SMAC 및 Hanabi와 같은 표준 MARL 환경에서 제공하는 협동 작업을 대상으로 ePymarl 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1분산형 MARL 알고리즘이 순차적 학습보다 빠른 수렴을 달성하면서도 안정성을 유지할 수 있는가?
  • RQ2다중 시간스케일 학습이 협동 MARL에서 독립 학습보다 비정상성을 줄이는가?
  • RQ3다른 속도로 동시에 학습하는 것이 기존 최신 기술의 분산형 MARL 방법보다 협동 환경에서 더 나은 성능을 내는가?
  • RQ4학습 속도 비율의 선택이 다에이전트 환경에서 학습 안정성과 샘플 효율성에 어떤 영향을 미치는가?
  • RQ5다중 시간스케일 학습은 확장 가능하고 일반화 가능한 분산형 협동 MARL을 위한 프레임워크인가?

주요 결과

  • 제안된 다중 시간스케일 학습 방법은 단일 에이전트를 한 번에 업데이트하는 순차적 학습보다 더 빠른 수렴을 달성한다.
  • 독립 학습(모든 에이전트가 유사한 속도로 동시에 업데이트)과 비교해 비정상성이 크게 감소한다.
  • ePymarl 벤치마크에서 최종 수익과 학습 안정성 측면에서 최신 기술의 분산형 MARL 알고리즘을 능가한다.
  • 특히 SMAC(Simplified Multi-Agent Control) 및 Hanabi와 같은 복잡한 협동 환경에서 성능 향상이 두드러진다.
  • 보조 에이전트에 대해 느린 학습 속도를 사용함으로써 정책 이탈이 효과적으로 감쇠되어 전체 학습 안정성이 향상된다.
  • 실험 결과는 이 방법이 다양한 협동 작업에서 높은 샘플 효율성과 일반화 능력을 유지함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.