Skip to main content
QUICK REVIEW

[논문 리뷰] On Improving Model-Free Algorithms for Decentralized Multi-Agent Reinforcement Learning

Weichao Mao, Lin F. Yang|arXiv (Cornell University)|2021. 10. 12.
Advanced Bandit Algorithms Research인용 수 5
한 줄 요약

이 논문은 다중 에이전트의 고통을 극복하기 위해 중심화된 조율 없이 관련 균형과 내쉬 균형을 효율적으로 학습할 수 있도록 하는 분산형, 모델 기반 아님 알고리즘을 제안한다. 일반합 마르코프 게임에 대한 단계 기반 V-학습 방법과 잠재력 게임에 대한 독립적 정책 그래디언트 및 모멘텀 기반 분산 감소 기법을 도입하여, 일반합 마르코프 게임에서 균형의 근사치를 학습하는 데 샘플 복잡도 한계 $ widetilde{O}(H^5 S A_{ ext{max}} / \ varepsilon^2)$ 와 잠재력 게임에서 내쉬 균형을 학습하는 데 $ widetilde{O}(1/ varepsilon^4)$ 를 달성한다.

ABSTRACT

Multi-agent reinforcement learning (MARL) algorithms often suffer from an exponential sample complexity dependence on the number of agents, a phenomenon known as \emph{the curse of multiagents}. In this paper, we address this challenge by investigating sample-efficient model-free algorithms in \emph{decentralized} MARL, and aim to improve existing algorithms along this line. For learning (coarse) correlated equilibria in general-sum Markov games, we propose \emph{stage-based} V-learning algorithms that significantly simplify the algorithmic design and analysis of recent works, and circumvent a rather complicated no-\emph{weighted}-regret bandit subroutine. For learning Nash equilibria in Markov potential games, we propose an independent policy gradient algorithm with a decentralized momentum-based variance reduction technique. All our algorithms are decentralized in that each agent can make decisions based on only its local information. Neither communication nor centralized coordination is required during learning, leading to a natural generalization to a large number of agents. We also provide numerical simulations to corroborate our theoretical findings.

연구 동기 및 목표

  • 에이전트 수가 증가함에 따라 연합 행동 공간이 지수적으로 증가하는 분산형 다중 에이전트 강화학습에서의 다중 에이전트 고통 문제를 해결한다.
  • 학습 중 중심화된 조율나 사전 통신이 필요 없는 샘플 효율적인, 모델 기반 아님 알고리즘을 개발한다.
  • 일반합 마르코프 게임에서 균형의 근사치를 학습하는 데 이론적 수렴 보장을 달성한다.
  • 복잡한 손실 최소화 서브루틴을 새로운 단계 기반 V-학습 프레임워크로 대체함으로써 알고리즘 설계를 단순화한다.
  • 모의 환경에서 독립 학습과 기준 기반 벤치마크에 비해 실증적으로 뛰어난 성능을 보여준다.

제안 방법

  • 일반합 마르코프 게임에 적합한 단계 기반 V-학습 알고리즘을 제안하여, 복잡한 가중치 없는 손실 최소화 기반 하이브리드 서브루틴이 필요 없도록 한다.
  • 잠재력 게임에 적합한 독립적 정책 그래디언트 방법을 도입하고, 분산형 모멘텀 기반 분산 감소 기법을 적용한다.
  • 완전한 분산화를 확보한다: 각 에이전트는 통신이나 조율 없이 국소 정보(국소 행동, 보상, 가치 추정치)만을 사용한다.
  • 유익한 가치 함수 추정과 매개변수 $\gamma_i$ 를 통한 암묵적 탐색을 사용하여 V-학습에서 충분한 탐색을 장려한다.
  • 성능 비교를 위해 중심화된 오라클 벤치마크에서 호프딩 기반 신뢰 구간과 UCB-ADVANTAGE 스타일 업데이트를 적용한다.
  • 수렴성과 안정성에 최적화된 적응형 단계 크기 $\eta_i$ 와 모멘텀 매개변수 $a_t$ 를 사용하여 알고리즘을 구현한다.

실험 결과

연구 질문

  • RQ1복잡한 손실 최소화 서브루틴에 의존하지 않고도 일반합 마르코프 게임에서 균형의 근사치를 학습하는 더 단순하고 효율적인 모델 기반 아님 알고리즘을 설계할 수 있는가?
  • RQ2통신 없이 분산된 환경에서 잠재력 게임에서 내쉬 균형을 효율적으로 학습할 수 있는 방법은 무엇인가?
  • RQ3대규모 다중 에이전트 시스템에서 균형을 학습하는 데 있어 분산형, 모델 기반 아님 MARL 알고리즘의 이론적 샘플 복잡도는 무엇인가?
  • RQ4전략적 상호작용이 존재하는 다중 에이전트 환경에서 분산 알고리즘이 단순한 독립 학습보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5실제로 이론적 한계와 실증 성능 간의 비교는 어떻게 이루어지며, 특히 수렴 속도와 최종 성능 측면에서 어떤가?

주요 결과

  • 단계 기반 V-학습 알고리즘은 일반합 마르코프 게임에서 $ widetilde{O}(H^5 S A_{\text{max}} / \ varepsilon^2)$ 의 샘플 복잡도를 달성하여 $ varepsilon$-근사 균형의 학습을 가능하게 한다.
  • 잠재력 게임의 경우, 모멘텀 기반 분산 감소 기법을 적용한 독립적 정책 그래디언트는 $ widetilde{O}(1/\ varepsilon^4)$ 의 샘플 복잡도를 달성하여 $ varepsilon$-근사 내쉬 균형을 학습한다.
  • 수치 시뮬레이션 결과, 제안된 두 알고리즘이 독립 Q-학습 기준 기반과 비교해 뛰어난 성능을 보이며, GoodState 및 BoxPushing 과제에서 중심화된 오라클의 성능에 가까워진다.
  • 이론적 한계보다 실질적으로 더 빠르게 수렴하는 것으로 나타나, 이론적 샘플 복잡도 한계가 보수적일 수 있음을 시사한다.
  • 분산형 모멘텀 기반 분산 감소 기법은 잠재력 게임의 정책 그래디언트 방법에서 학습 안정성을 효과적으로 향상시키고 수렴성을 개선한다.
  • 제안된 방법은 완전히 분산형이며 통신이나 중심화된 조율이 필요 없어 대규모 수의 에이전트에 쉽게 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.