Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Gradient With Value Function Approximation For Collective Multiagent Planning

Duc Thien Nguyen, Akshat Kumar|arXiv (Cornell University)|2018. 04. 09.
Reinforcement Learning in Robotics참고 문헌 30인용 수 14
한 줄 요약

이 논문은 $ℂ$ Dec-POMDPs에서 집단적 다중에이전트 계획을 위한 값 함수 근사와 함께 요인 분해된 액터-크리틱 강화 학습 방법을 제안한다. 여기서 에이전트 상호작용은 개별 정체성 대신 집단적 행동에 의해 규정된다. 행동-가치 함수를 분해하고 크리틱을 국소 값 함수를 사용하여 훈련시킴으로써, 이 방법은 기존의 액터-크리틱 및 이전의 표본 기반 방법에 비해 더 빠른 수렴과 뛰어난 해의 품질을 달성하며, 최대 8,000명의 에이전트를 포함하는 실제 택시 풍경 문제에서의 확장성을 입증한다.

ABSTRACT

Decentralized (PO)MDPs provide an expressive framework for sequential decision making in a multiagent system. Given their computational complexity, recent research has focused on tractable yet practical subclasses of Dec-POMDPs. We address such a subclass called CDEC-POMDP where the collective behavior of a population of agents affects the joint-reward and environment dynamics. Our main contribution is an actor-critic (AC) reinforcement learning method for optimizing CDEC-POMDP policies. Vanilla AC has slow convergence for larger problems. To address this, we show how a particular decomposition of the approximate action-value function over agents leads to effective updates, and also derive a new way to train the critic based on local reward signals. Comparisons on a synthetic benchmark and a real-world taxi fleet optimization problem show that our new AC approach provides better quality solutions than previous best approaches.

연구 동기 및 목표

  • 불확실성 하에서 표본 정책 표현의 확장성 한계를 해결하기 위해.
  • 대규모 Dec-POMDPs에 대한 액터-크리틱 강화 학습의 샘플 효율성과 수렴 속도를 향상시키기 위해.
  • 집단적 에이전트 상호작용을 활용하면서도 분산된 정책 학습을 가능하게 하는 값 함수 근사 기법을 개발하기 위해.
  • 도시 택시 풍경과 같은 실제 대규모 다중에이전트 시스템에서 효과적인 정책 최적화를 가능하게 하기 위해.
  • 고에이전트 수를 가진 합성 및 실제 벤치마크에서 방법의 유효성을 검증하기 위해.

제안 방법

  • $ℂ$ Dec-POMDPs에서 집단적 에이전트 상호작용에 기반해 행동-가치 함수를 분해하는 요인 분해 액터-크리틱(fAfC) 프레임워크를 제안한다.
  • 편향을 줄이고 학습 안정성을 향상시키기 위해 호환성 있는 값 함수 근사 기반의 정책 기울기 업데이트를 유도한다.
  • 전역 값 추정을 향상시키기 위해 개별 에이전트의 값 함수를 활용하는 새로운 크리틱 훈련 방법을 도입하여 샘플 효율성을 향상시킨다.
  • 정책과 값 함수에 함수 근사(예: 신경망)를 적용하여 표본 표현을 피하고 확장성을 확보한다.
  • 국소 관측치와 카운트 기반으로 개별 기여도의 합으로서 연합 행동-가치 함수를 모델링하기 위해 값 함수의 요인 분해를 적용한다.
  • 전역 수익 추정에 의존도를 줄이고 수렴성을 향상시키기 위해 개별 에이전트의 국소 보상 신호를 사용해 크리틱을 훈련시킨다.

실험 결과

연구 질문

  • RQ1값 함수 근사와 함께 요인 분해된 액터-크리틱 방법이 대규모 집단적 다중에이전트 계획에서 기존의 액터-크리틱보다 뛰어난 성능을 보일 수 있는가?
  • RQ2개별 에이전트의 값 함수를 사용해 크리틱을 훈련시키는 것이 $ℂ$ Dec-POMDPs에서 더 빠른 수렴과 더 나은 정책 품질을 이끌 수 있는가?
  • RQ3집단적 에이전트 행동 기반의 값 함수 요인 분해가 고차원 관측 공간에서 확장성과 성능을 어떻게 향상시키는가?
  • RQ4제안된 방법이 실제 대규모 시스템, 예를 들어 8,000명의 에이전트를 포함한 택시 풍경에서 효과적으로 정책 최적화를 수행할 수 있는가?
  • RQ5관측 공간이 증가함에 따라 표본 정책 최적화(예: EM)와 비교했을 때, 이 방법은 해의 품질과 수렴성 측면에서 어떤가?

주요 결과

  • 근접 관측 기반(oN)을 사용한 8,000대 택시 문제에서 fAfC는 베이스라인 fAfC-o0 대비 64% 향상된 해의 품질을 달성했다.
  • fAfC-oN은 fAfC-o1 대비 20% 향상된 성능을 보여, 다중 근접 지역 관측 모델링이 정책 품질 향상에 기여함을 확인했다.
  • EM-`oN'은 조각별 정책를 가졌음에도 불구하고 30,000 반복 이내에 수렴하지 못했고 결과적으로 열 劣한 성능을 보였다.
  • 요인 분해된 크리틱 훈련 전략은 전역 경험 수익을 사용한 훈련보다 더 빠른 수렴을 가능하게 하여 샘플 분산 감소 효과를 입증했다.
  • 기존의 액터-크리틱(AC) 및 fAC 변종은 동일한 설정에서 수렴하지 못했으며, 제안된 요인 분해 아키텍처와 훈련 방법의 필요성을 입증했다.
  • 합성 로봇 주행 작업에서 fAfC-oN은 EM 및 SMFU를 모두 능가하는 최상의 해의 품질을 달성했으며, 특히 혼잡도가 높은 상황에서 두드러진 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.