Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Parameter Sharing in Multi-Agent Deep Reinforcement Learning

Justin K. Terry, Nathaniel Grammel|arXiv (Cornell University)|2020. 05. 27.
Reinforcement Learning in Robotics참고 문헌 30인용 수 12
한 줄 요약

이 논문은 다중 에이전트 강화학습에서 이전에 미처 활용되지 않았던 파라미터 공유 기법이 완전한 중심화를 통해 비정적성(nonstationarity)을 제거함으로써 학습 속도를 크게 향상시키고 성능을 향상시킴을 보여준다. 저자들은 8종의 현대적 딥 강화학습 알고리즘에 파라미터 공유를 적용하여, 이전의 파라미터 공유 설정 대비 최소 16%의 에피소드 수로 44배 높은 평균 보상에 도달함으로써 벤치마크 MARL 환경에서 새로운 최고 성능(SOTA)을 달성하였으며, 관측 및 행동 공간 패딩을 통해 이 기법을 이질적인 에이전트로까지 확장하였다.

ABSTRACT

Parameter sharing, where each agent independently learns a policy with fully shared parameters between all policies, is a popular baseline method for multi-agent deep reinforcement learning. Unfortunately, since all agents share the same policy network, they cannot learn different policies or tasks. This issue has been circumvented experimentally by adding an agent-specific indicator signal to observations, which we term "agent indication". Agent indication is limited, however, in that without modification it does not allow parameter sharing to be applied to environments where the action spaces and/or observation spaces are heterogeneous. This work formalizes the notion of agent indication and proves that it enables convergence to optimal policies for the first time. Next, we formally introduce methods to extend parameter sharing to learning in heterogeneous observation and action spaces, and prove that these methods allow for convergence to optimal policies. Finally, we experimentally confirm that the methods we introduce function empirically, and conduct a wide array of experiments studying the empirical efficacy of many different agent indication schemes for image based observation spaces.

연구 동기 및 목표

  • 협동적 다중 에이전트 강화학습에서 학습 중심화를 증가시켜 비정적성을 완화하는지 조사하기.
  • 현대적 딥 RL 알고리즘에 대한 파라미터 공유(극한의 중심화)가 MARL 벤치마크에서 성능에 미치는 영향 평가하기.
  • 다른 관측 및 행동 공간을 가진 이질적 에이전트로 파라미터 공유를 확장하기.
  • 에이전트 표시, 관측 패딩, 행동 공간 패딩이 이질적 MARL 환경에서 파라미터 공유를 가능하게 하는 데 있어 공식적으로 증명 가능한 타당성 확보하기.

제안 방법

  • MAILP 모델을 사용하여 정보 전달 동역학을 수식화하고, 중심화 정도에 따라 변화하는 학습 수렴 속도에 대한 이론적 한계를 도출한다.
  • 문헌상으로는 처음으로 8종의 현대적 딥 RL 알고리즘(SAC, PPO, SAC-BC 등)에 파라미터 공유를 적용하여 단일 에이전트 방법을 다중 에이전트 환경에 적용한다.
  • 에이전트 표시를 사용하여 관측 내에서 에이전트 식별 정보를 조건으로 삼아, 하나의 공유 정책이 각 에이전트에 따라 다르게 행동하도록 한다.
  • 관측 패딩은 더 작은 관측을 가장 큰 관측 크기로 확장하여 모든 에이전트 간 입력 차원을 통일함으로써 입력 구조를 유지한다.
  • 행동 공간 패딩은 더 작은 행동 공간을 가장 큰 크기로 확장하고, 범위를 초월하는 행동은 잘라냄으로써 이질적인 행동 공간을 정렬한다.
  • 에이전트 표시, 관측 패딩, 행동 공간 패딩이 이질적 에이전트에 대한 파라미터 공유를 가능하게 하는 데 있어 정당성과 기능성을 보장하는 이론적 증명을 제공한다.

실험 결과

연구 질문

  • RQ1최종적으로 파라미터 공유로 이르는 학습 중심화를 증가시키면, 협동적 MARL에서 수렴 속도가 빨라지고 성능이 향상되는가?
  • RQ2DQN과 DDPG와 같은 초기 방법 외에도 현대적 딥 강화학습 알고리즘에 파라미터 공유를 성공적으로 적용할 수 있는가?
  • RQ3관측 및 행동 공간 크기가 다른 이질적 에이전트가 포함된 환경에 파라미터 공유를 어떻게 확장할 수 있는가?
  • RQ4에이전트 표시, 관측 패딩, 행동 공간 패딩 같은 방법들이 이질적 MARL 환경에서 파라미터 공유를 가능하게 하는 데 있어 어떤 이론적 보장을 제공할 수 있는가?
  • RQ5표준 MARL 벤치마크에서 최첨단 DRL 알고리즘에 파라미터 공유를 적용했을 때 기대할 수 있는 성능 향상은 어느 정도인가?

주요 결과

  • Gupta 등(2017)의 MARL 벤치마크 세트에서 파라미터 공유가 문서화된 바 가장 높은 성능를 기록하며 새로운 최고 성능(SOTA)을 수립하였다.
  • 이전에 보고된 파라미터 공유 설정 대비 최대 44배 높은 평균 누적 보상을 달성하였다.
  • 이전의 파라미터 공유 방법에 비해 필요한 에피소드 수의 최소 16%로 성능을 달성하여 샘플 효율성 향상이 뚜렷하게 나타났다.
  • 현대적 DRL 알고리즘 중에서는 프록시멀 피드백 최적화(PPO)와 소프트 액터-크리틱(SAC)이 파라미터 공유와 조합했을 때 특히 뛰어난 성능를 보였다.
  • 이론적 분석을 통해 파라미터 공유가 정책 학습을 완전히 중심화함으로써 비정적성에 기인한 수렴 지연을 제거함을 확인하였다.
  • 제안된 방법들인 에이전트 표시, 관측 패딩, 행동 공간 패딩이 이질적 MARL 환경에서 정확성과 기능성을 유지함을 공식적으로 증명하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.