Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-Agent Off-Policy Actor-Critic Algorithm for Distributed Reinforcement Learning

Wesley A. Suttle, Zhuoran Yang|arXiv (Cornell University)|2019. 03. 15.
Reinforcement Learning in Robotics참고 문헌 29인용 수 7
한 줄 요약

이 논문은 시간 변화하는 네트워크에서 분산 강화학습을 위한 새로운 다중 에이전트 비정책 액터-크리틱 알고리즘을 제안한다. 비용 함수 갱신에는 공감 기반 강조 시간 차이(ETD) 방법을 사용하고, 액터 갱신에는 강조 가중치를 사용하는 새로운 다중 에이전트 비정책 정책 그래เดียน트 정리가 적용된다. 이 방법은 선형 함수 근사 하에서 거의 확실한 수렴을 보장하여, 비정책 경험을 효율적이고 탈중앙화된 방식으로 학습할 수 있도록 한다.

ABSTRACT

This paper extends off-policy reinforcement learning to the multi-agent case in which a set of networked agents communicating with their neighbors according to a time-varying graph collaboratively evaluates and improves a target policy while following a distinct behavior policy. To this end, the paper develops a multi-agent version of emphatic temporal difference learning for off-policy policy evaluation, and proves convergence under linear function approximation. The paper then leverages this result, in conjunction with a novel multi-agent off-policy policy gradient theorem and recent work in both multi-agent on-policy and single-agent off-policy actor-critic methods, to develop and give convergence guarantees for a new multi-agent off-policy actor-critic algorithm.

연구 동기 및 목표

  • 시간 변화하는 그래프를 통해 통신하는 탈중앙화된 네트워크 기반 다중 에이전트 시스템에 비정책 강화학습을 확장한다.
  • 공감 기반 ETD(λ) 변형을 사용하여 다중 에이전트 시스템에서 비정책 정책 평가를 이론적으로 기반한 방법으로 개발한다.
  • 행동 정책의 분포 이탈을 보정하기 위해 강조 가중치를 사용하는 새로운 다중 에이전트 비정책 정책 그래เดียน트 정리를 수립한다.
  • 비정책 경험을 활용하는 완전히 탈중앙화된 액터-크리틱 알고리즘을 설계하여 분산 다중 에이전트 강화학습에서 효율적이고 자원 재사용이 가능한 학습을 가능하게 한다.
  • 가격 함수에 대한 선형 함수 근사 하에서 제안된 알고리즘이 거의 확실하게 수렴함을 증명한다.

제안 방법

  • 비정책 비용 함수 갱신을 가능하게 하기 위해 다중 에이전트 가치 함수 추정을 위한 공감 기반 강조 시간 차이 학습(ETD(λ))의 변형을 사용한다.
  • 비정책 샘플링을 탈중앙화 방식으로 보정하기 위해 강조 가중치를 사용하는 새로운 다중 에이전트 비정책 정책 그래เดียน트 정리를 도입한다.
  • 비정책 보정을 위해 중요도 샘플링 비율 ρ_t = π(a|s)/μ(a|s)을 사용하여 전이를 재가중한다. 이는 비용 함수 및 액터 갱신 모두에 적용된다.
  • 이중 레벨 갱신 구조를 적용한다: 내부 공감 루프를 통해 이웃 간의 로그 중요도 비율을 집계한 후 전역 ρ_t를 계산한다.
  • 학습 안정성을 높이기 위해 강조 가중치 M^θ_t = 1 + λ^θ γ ρ_{t-1} F_{t-1} 를 사용한 수정된 정책 그래디언트를 액터 갱신에 구현한다.
  • 가격 함수에 대해 선형 함수 근사를 사용하고, 수렴성을 확보하기 위해 확률적 근사 조건을 만족하는 스텝 사이즈 규칙을 적용한다.

실험 결과

연구 질문

  • RQ1비정책 학습은 시간 변화하는 통신 네트워크를 가진 탈중앙화된 다중 에이전트 시스템으로 효과적으로 확장될 수 있는가?
  • RQ2분산 다중 에이전트 환경에서 비정책 정책 평가를 어떻게 안정화하고 수렴 가능하게 만들 수 있는가?
  • RQ3탈중앙화된 액터 갱신을 가능하게 하는 다중 에이전트 비정책 정책 그래디언트 정리의 올바른 형태는 무엇인가?
  • RQ4비정책 경험을 활용하는 완전히 탈중앙화된 액터-크리틱 알고리즘이 선형 함수 근사 하에서 거의 확실하게 수렴할 수 있는가?
  • RQ5강조 가중치와 공감 기반 중요도 비율 집계는 분산 다중 에이전트 강화학습에서 표본 효율성과 수렴성을 어떻게 향상시키는가?

주요 결과

  • 제안된 다중 에이전트 비정책 액터-크리틱 알고리즘은 가치 함수에 대한 선형 함수 근사 하에서 최적 정책으로 거의 확실하게 수렴한다.
  • 분포 이탈을 보정하기 위해 강조 가중치를 사용하는 새로운 다중 에이전트 비정책 정책 그래디언트 정리를 통해 수렴성이 입증된다.
  • 비용 함수는 비정책 전이가 존재하더라도 안정적인 가치 함수 학습을 보장하는 공감 기반 ETD(λ) 변형을 사용한다.
  • 중요도 비율을 위한 내부 공감 루프 덕분에, 전역 동기화가 필요 없이 각 에이전트가 일관된 네트워크 집합된 ρ_t 추정치를 계산할 수 있다.
  • 실증 결과는 선형 함수 근사 설정에서 이론적 수렴 보장을 검증하며, 안정적이고 효율적인 학습을 보여준다.
  • 이 방법은 분산 환경에서 비정책 경험을 재사용할 수 있어, 표본 효율성 면에서 온정책 기반 방법을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.