Skip to main content
QUICK REVIEW

[논문 리뷰] Cooperative Multi-Agent Reinforcement Learning with Partial Observations

Yan Zhang, Michael M. Zavlanos|arXiv (Cornell University)|2020. 06. 18.
Reinforcement Learning in Robotics참고 문헌 20인용 수 9
한 줄 요약

이 논문은 부분 관찰 하에서 협동 다중 에이전트 강화 학습(MARL)에 대해 분산 제로차수 정책 최적화 방법을 제안한다. 이는 에이전트들이 전역 보상의 국소적 공감 기반 추정치를 사용하여 정책 기울기를 추정할 수 있도록 한다. 주요 기여는 분산된 정책 기울기 추정의 분산을 감소시키고 샘플 효율성을 향상시키는 새로운 잔차 피드백 기반 기울기 추정기이다. 이는 일정 단계 크기 하에서 정적 정책의 이웃으로 수렴함을 보장한다.

ABSTRACT

In this paper, we propose a distributed zeroth-order policy optimization method for Multi-Agent Reinforcement Learning (MARL). Existing MARL algorithms often assume that every agent can observe the states and actions of all the other agents in the network. This can be impractical in large-scale problems, where sharing the state and action information with multi-hop neighbors may incur significant communication overhead. The advantage of the proposed zeroth-order policy optimization method is that it allows the agents to compute the local policy gradients needed to update their local policy functions using local estimates of the global accumulated rewards that depend on partial state and action information only and can be obtained using consensus. Specifically, to calculate the local policy gradients, we develop a new distributed zeroth-order policy gradient estimator that relies on one-point residual-feedback which, compared to existing zeroth-order estimators that also rely on one-point feedback, significantly reduces the variance of the policy gradient estimates improving, in this way, the learning performance. We show that the proposed distributed zeroth-order policy optimization method with constant stepsize converges to the neighborhood of a policy that is a stationary point of the global objective function. The size of this neighborhood depends on the agents' learning rates, the exploration parameters, and the number of consensus steps used to calculate the local estimates of the global accumulated rewards. Moreover, we provide numerical experiments that demonstrate that our new zeroth-order policy gradient estimator is more sample-efficient compared to other existing one-point estimators.

연구 동기 및 목표

  • 에이전트가 전역 상태와 행동에 부분적으로만 액세스할 수 있는 상황에서 협동 다중 에이전트 강화 학습(MARL)의 과제를 해결하며, 높은 통신 오버헤드를 피한다.
  • 중앙 집중식 크리틱이나 전체 상태/행동 공유가 필요 없는 탈중앙화된 정책 최적화 방법을 개발한다.
  • 다중 에이전트 환경에서의 제로차수 정책 기울기 추정기의 분산을 줄여 학습 안정성과 샘플 효율성을 향상시킨다.
  • 공감을 통한 가치 추적을 도입하여 정확한 전역 보상 추정을 위해 필요한 공감 단계 수를 줄인다.
  • 일정 단계 크기 하에서도 알고리즘이 정적 정책의 이웃으로 수렴하도록 보장한다.

제안 방법

  • 기존의 한 점 기반 추정기보다 분산이 낮은 성능을 보이는 한 점 잔차 피드백을 사용하는 분산 제로차수 기울기 추정기를 제안한다.
  • 에이전트들이 통신 네트워크를 통해 얻은 전역 누적 보상의 국소적 추정치만을 사용하여 국소 정책 기울기를 계산할 수 있도록 한다.
  • 에이전트들이 국소 정보를 사용하여 전역 목표 함수 값의 추정치를 유지하고 업데이트할 수 있도록 가치 추적 메커니즘을 통합한다.
  • 전체 네트워크 상태 정보에 의존하는 것의 의존도를 줄이기 위해 공감 기반 알고리즘을 사용하여 전역 보상의 국소 근사치를 계산한다.
  • 정책 업데이트 규칙에 일정 단계 크기를 적용하여 정적 정책의 이웃으로 수렴하도록 보장한다.
  • 기울기 계산을 피하기 위해 연속적인 정책 변형 간의 함수 값 차이를 사용하여 정책 기울기 추정기를 수립한다.

실험 결과

연구 질문

  • RQ1에이전트들이 전역 크리틱에 액세스할 수 없고 부분 상태와 행동만 관찰할 경우, 탈중앙화된 MARL 알고리즘이 수렴할 수 있는가?
  • RQ2부분 관찰 하에서 분산된 다중 에이전트 환경에서 제로차수 정책 기울기 추정의 분산은 어떻게 감소시킬 수 있는가?
  • RQ3공감 단계 수와 통신 그래프 구조는 정책 기울기 추정의 편향과 분산에 어떤 영향을 미치는가?
  • RQ4가치 추적은 공감 단계 수를 줄여 제로차수 MARL의 샘플 효율성을 향상시킬 수 있는가?
  • RQ5부분 관찰 하에서 제안된 방법은 중심 집중형 기준과 비교해 성능 및 확장성 측면에서 어떻게 다른가?

주요 결과

  • 제안된 잔차 피드백 기반 제로차수 추정기는 기존의 한 점 추정기보다 기울기 분산을 크게 감소시켜 학습 성능을 향상시킨다.
  • 일정 단계 크기 하에서 알고리즘이 전역 목표 함수의 정적 정책의 이웃으로 수렴하며, 이 이웃의 크기는 학습률, 탐색 파라미터 및 공감 단계 수에 따라 달라진다.
  • 가치 추적은 에피소드당 필요한 공감 단계 수를 줄여 효율성을 향상시키며, 수렴 품질을 손상시키지 않는다.
  • 수치 실험 결과, 제안된 방법은 특히 공통 통신 그래프가 아닌 경우 기존의 기준 한 점 추정기보다 샘플 효율성이 뛰어나다.
  • 공감 단계 수가 증가함에 따라 분산 알고리즘의 성능이 부분 관찰 하에서 중심 집중형 알고리즘에 수렴한다.
  • 공감 행렬 $\rho_W$ 의 두 번째로 큰 특이값은 수렴 속도와 기울기 분산과 관련이 있으며, 이는 더 빠른 공감 그래프가 더 낮은 분산을 유도함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.