Skip to main content
QUICK REVIEW

[논문 리뷰] F2A2: Flexible Fully-decentralized Approximate Actor-critic for Cooperative Multi-agent Reinforcement Learning

Wenhao Li, Bo Jin|arXiv (Cornell University)|2020. 04. 17.
Reinforcement Learning in Robotics참고 문헌 75인용 수 12
한 줄 요약

F2A2는 중앙집중화된 조율 없이도 확장성 있고 안정적인 훈련을 가능하게 하는 유연하고 완전히 탈중앙화된 액터-크리틱 프레임워크를 제안한다. 원시-이중 혼합 경사 하강법과 파rameter 공유, 그리고 이론적 마음 모델링을 기반으로 한 온라인 지도 학습을 통해 다른 에이전트를 모델링함으로써, F2A2는 통신 오버헤드를 감소시키고 정책 학습의 편향을 완화하며, 스타크래프트 II와 다중에이전트 입자 환경에서 중앙집중식 및 탈중앙식 기준선과 경쟁 가능한 성능을 달성한다.

ABSTRACT

Traditional centralized multi-agent reinforcement learning (MARL) algorithms are sometimes unpractical in complicated applications, due to non-interactivity between agents, curse of dimensionality and computation complexity. Hence, several decentralized MARL algorithms are motivated. However, existing decentralized methods only handle the fully cooperative setting where massive information needs to be transmitted in training. The block coordinate gradient descent scheme they used for successive independent actor and critic steps can simplify the calculation, but it causes serious bias. In this paper, we propose a flexible fully decentralized actor-critic MARL framework, which can combine most of actor-critic methods, and handle large-scale general cooperative multi-agent setting. A primal-dual hybrid gradient descent type algorithm framework is designed to learn individual agents separately for decentralization. From the perspective of each agent, policy improvement and value evaluation are jointly optimized, which can stabilize multi-agent policy learning. Furthermore, our framework can achieve scalability and stability for large-scale environment and reduce information transmission, by the parameter sharing mechanism and a novel modeling-other-agents methods based on theory-of-mind and online supervised learning. Sufficient experiments in cooperative Multi-agent Particle Environment and StarCraft II show that our decentralized MARL instantiation algorithms perform competitively against conventional centralized and decentralized methods.

연구 동기 및 목표

  • 중앙집중화된 훈련의 한계, 즉 확장성 문제와 통신 병목 현상을 해결하기 위해.
  • 기존 탈중앙화된 다중에이전트 강화학습 방법에서 블록 좌표 강하에 의해 유도되는 편향을 제거하기 위해, 각 에이전트별로 정책과 가치 함수를 동시에 최적화할 수 있도록 하기 위해.
  • 최소한의 정보 교환으로도 대규모 협동 다중에이전트 환경을 지원할 수 있는 완전히 탈중앙화된 프레임워크를 설계하기 위해.
  • 에이전트들이 사적 목표를 가지고 있으며 관측 가능성이 제한된 부분 관측 스토케스틱 게임(POSGs)에서 안정성과 확장성을 향상시키기 위해.
  • 중앙집중 제어기나 전역 상태 정보에 의존하지 않고 효과적인 다중에이전트 정책 학습을 가능하게 하기 위해.

제안 방법

  • 각 에이전트의 정책(액터)과 가치 함수(크리틱)를 탈중앙화된 방식으로 동시에 최적화하기 위해 원시-이중 혼합 경사 하강법 프레임워크를 활용한다.
  • 유한한 메모리 압축과 단일 레이어 LSTM을 사용하여 믿음 상태를 근사함으로써, 다른 에이전트 행동의 압축 표현을 가능하게 한다.
  • 이론적 마음 모델링과 온라인 지도 학습을 기반으로 한 새로운 다른 에이전트 모델링 방법을 도입하여, 직접 관측하지 않고도 다른 에이전트의 정책을 추론한다.
  • 에이전트 간의 파라미터 공유를 적용하여 모델 복잡성과 통신 오버헤드를 감소시킨다.
  • 다양한 액터-크리틱 방법을 통합할 수 있는 탄력적인 아키텍처를 설계하여 호환성과 확장성을 향상시킨다.
  • 중앙 제어기를 의존하지 않는 탈중앙화된 훈련 및 실행(DTDE) 패러다임을 구현한다.

실험 결과

연구 질문

  • RQ1완전히 탈중앙화된 액터-크리틱 프레임워크는 중앙집중화된 조율 없이도 협동 다중에이전트 강화학습에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2탈중앙화된 다중에이전트 강화학습에서 순차적 액터-크리틱 업데이트로 인한 편향을 어떻게 줄일 수 있는가? (통합 최적화를 통해)
  • RQ3파라미터 공유와 이론적 마음 모델링 기반의 모델링이 통신을 얼마나 줄이고 확장성을 얼마나 향상시킬 수 있는가?
  • RQ4단일 레이어 LSTM 기반 정책이 부분 관측 환경에서 다수 수준의 믿음 구조를 효과적으로 근사할 수 있는가?
  • RQ5개별 목표를 가진 대규모 협동 환경에서 제안된 프레임워크는 어떻게 성능을 발휘하는가?

주요 결과

  • F2A2는 스타크래프트 II와 다중에이전트 입자 환경에서 경쟁 가능한 성능을 달성하며, 핵심 지표에서 중앙집중식 및 탈중앙식 기준선을 능가하거나 동등하게 유지한다.
  • 파라미터 공유와 다른 에이전트의 온라인 모델링을 통해 정보 전송을 크게 줄여 통신 효율성을 향상시켰다.
  • 원시-이중 방법을 통한 정책과 가치 함수의 통합 최적화로 훈련이 안정화되었으며, 기존 블록 좌표 강하 기반 방법에서 유발되는 편향을 완화했다.
  • 이론적 마음 모델링 기반의 모델링을 통해 관측 가능성이 제한된 상황에서도 다른 에이전트의 행동을 효과적으로 추론할 수 있었으며, 이는 협업 능력을 향상시켰다.
  • 실험 결과, F2A2는 대규모 협동 환경에서도 안정성과 확장성을 유지하며 다양한 환경에서 뛰어난 견고성을 입증했다.
  • 단일 레이어 LSTM을 사용하고도 프레임워크가 뛰어난 성능을 발휘함으로써, 실질적으로 유한한 믿음 계층을 효과적으로 근사할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.