Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Trust Region Policy Optimization

Hepeng Li, Haibo He|arXiv (Cornell University)|2020. 10. 15.
Reinforcement Learning in Robotics참고 문헌 32인용 수 10
한 줄 요약

이 논문은 협동적 부분 관측 마르코프 게임(cooperative partially observable Markov games)을 위한 신뢰영역 정책 최적화(Trust Region Policy Optimization, TRPO) 기반의 완전히 탈중앙화된 다중 에이전트 강화학습 알고리즘을 제안한다. TRPO의 정책 갱신을 ADMM를 사용한 분산 공감 최적화로 재구성함으로써, 에이전트들은 중앙 집중식 제어자, 전역 상태 또는 공유 파라미터가 없이도 피어 투 피어 통신을 통해 국소 정책 비율만 공유한다. 이로 인해 중앙 집중식 조율이 없이도 안정적인 훈련과 뛰어난 성능을 달성할 수 있다.

ABSTRACT

We extend trust region policy optimization (TRPO) to multi-agent reinforcement learning (MARL) problems. We show that the policy update of TRPO can be transformed into a distributed consensus optimization problem for multi-agent cases. By making a series of approximations to the consensus optimization model, we propose a decentralized MARL algorithm, which we call multi-agent TRPO (MATRPO). This algorithm can optimize distributed policies based on local observations and private rewards. The agents do not need to know observations, rewards, policies or value/action-value functions of other agents. The agents only share a likelihood ratio with their neighbors during the training process. The algorithm is fully decentralized and privacy-preserving. Our experiments on two cooperative games demonstrate its robust performance on complicated MARL tasks.

연구 동기 및 목표

  • 중앙 집중식 훈련의 한계, 즉 단일 장애 지점, 확장성 문제, 기밀성 문제를 해결하기 위해.
  • 협동적 부분 관측 환경에서 TRPO의 안정성과 샘플 효율성을 유지하는 완전히 탈중앙화된 MARL 알고리즘을 개발하기 위해.
  • 전역 정보나 중앙 제어자에 의존하지 않고 국소 관측과 피어 투 피어 통신만을 사용하여 효과적인 정책을 학습할 수 있도록 하기 위해.
  • ADMM를 통한 분산 최적화를 통해 TRPO의 신뢰영역 프레임워크를 다중 에이전트 시스템으로 확장하기 위해.

제안 방법

  • TRPO의 정책 갱신 규칙을 교대 방식의 다중변수 최적화(ADMM)를 사용해 분산 공감 최적화 문제로 재구성한다.
  • 에이전트들은 국소 선형화와 신뢰영역 제약 조건을 사용하여 전역 상태나 보상 정보가 없이도 안정적인 정책 갱신을 보장한다.
  • 알고리즘은 에이전트들이 이웃과 오직 국소 정책 비율만 교환하는 피어 투 피어 통신 프로토콜을 활용하며, 전체 정책나 가치 네트워크를 공유하지 않는다.
  • 보조 변수와 페널티 항을 증강 라그랑주안에 사용하여 에이전트 정책과 기울기 간의 공감을 강제한다.
  • 일阶 최적성 조건을 사용하여 최적의 정책 갱신을 유도하며, 정책 파라미터, 보조 변수, 공감 변수에 대해 닫힌 형태의 갱신식을 도출한다.
  • 해결책은 탈중앙화 방식으로 구현되며, 각 에이전트는 국소 기울기와 이웃으로부터 수신한 메시지를 기반으로 자체 정책 갱신을 계산한다.

실험 결과

연구 질문

  • RQ1부분 관측 조건 하에서 TRPO의 신뢰영역 정책 최적화가 협동적 다중 에이전트 시스템으로 효과적으로 확장될 수 있는가?
  • RQ2중앙 제어자가 없는 상태에서 완전히 탈중앙화된 MARL 알고리즘이 TRPO의 샘플 효율성과 안정성을 유지할 수 있는가?
  • RQ3협동 환경에서 효과적인 다중 에이전트 정책 학습을 위해 국소 정책 비율의 피어 투 피어 통신만으로도 충분한가?
  • RQ4성능와 확장성 측면에서 제안된 방법은 중앙 집중식 훈련 방법과 비교해 어떻게 성과를 내는가?

주요 결과

  • 제안된 알고리즘은 중앙 제어자나 전역 정보가 없이도 협동적 다중 에이전트 환경에서 안정적이고 효과적인 학습을 달성한다.
  • 실험 결과, 탈중앙화된 방법이 두 가지 협동 환경에서 중앙 집중식 훈련 기준선과 동등하거나 이를 초월하는 성능을 보였다.
  • 전역 상태나 보상 신호가 없더라도 신뢰영역 제약 조건을 통해 정책 안정성을 효과적으로 유지하였다.
  • 에이전트들은 국소 정책 비율의 피어 투 피어 교환을 통해 높은 누적 보상을 달성하였으며, 중앙 집중식 조율 없이도 효과적인 협동을 이룬다.
  • 완전히 탈중앙화된 설계 덕분에 알고리즘이 잘 확장되며, 중앙 집중식 접근 방식에 비해 통신 및 계산 오버헤드가 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.