Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Multi-Agent Reinforcement Learning with Selective Parameter Sharing

Filippos Christianos, Georgios Papoudakis|arXiv (Cornell University)|2021. 02. 15.
Reinforcement Learning in Robotics참고 문헌 24인용 수 17
한 줄 요약

이 논문은 학습 시작 전에 에이전트를 그들의 학습된 행동과 목표에 기반해 동적으로 군집으로 분할함으로써 유사한 에이전트 간에만 효율적이고 효과적인 파라미터 공유를 가능하게 하는 선택적 파라미터 공유(SePS)를 제안한다. SePS는 표면적 파라미터 공유나 독립 네트워크보다 더 높은 최종 수익을 달성하면서도 표본 효율성과 학습 속도를 향상시키며, 복잡한 환경에서 이질적인 수백 명의 에이전트로도 성공적으로 확장된다.

ABSTRACT

Sharing parameters in multi-agent deep reinforcement learning has played an essential role in allowing algorithms to scale to a large number of agents. Parameter sharing between agents significantly decreases the number of trainable parameters, shortening training times to tractable levels, and has been linked to more efficient learning. However, having all agents share the same parameters can also have a detrimental effect on learning. We demonstrate the impact of parameter sharing methods on training speed and converged returns, establishing that when applied indiscriminately, their effectiveness is highly dependent on the environment. We propose a novel method to automatically identify agents which may benefit from sharing parameters by partitioning them based on their abilities and goals. Our approach combines the increased sample efficiency of parameter sharing with the representational capacity of multiple independent networks to reduce training time and increase final returns.

연구 동기 및 목표

  • 비표면적 파라미터 공유가 이질적인 환경에서 학습에 악영향을 미치는 한계를 해결하기 위해.
  • 공유 표현에서 유익을 얻을 수 있는 에이전트 그룹을 식별하여 학습 효율성과 최종 성능을 향상시키기 위해.
  • 파라미터 공유의 이점과 독립 네트워크의 표현 능력을 조합함으로써 다중 에이전트 강화학습(MARL)을 수백 명의 에이전트로 확장하기 위해.
  • 공유 파라미터에서 갈등하는 정책 업데이트를 방지함으로써 학습 중 에이전트 간 간섭을 줄이기 위해.
  • 학습 중 동적 재구성 없이도 학습을 향상시키는 아키텍처 구성에 대한 사전학습 방법을 제공하기 위해.

제안 방법

  • 정책 학습이 시작되기 전에 수집된 트레이젝터리를 사용해 에이전트를 임베딩 공간으로 인코딩한다.
  • 임베딩에 비지도 군집 알고리즘을 적용하여 유사한 행동과 목표를 가진 에이전트를 그룹화한다.
  • 파라미터 공유를 각 군집 내에서만 적용하여 서로 다른 에이전트 그룹에 대해 별도의 신경망 헤드를 생성한다.
  • 이 방법은 사전학습 단계로, 정책 최적화가 시작되기 전에 고정된 아키텍처를 설정한다.
  • SePS는 MADDPG, Q-Mix, SEAC와 같은 경험 공유를 포함한 중심집중형 학습(CTDE) 프레임워크와 호환된다.
  • 각 에이전트 네트워크의 계산 오버헤드를 피하면서도 다양한 역할을 위한 표현 능력을 유지한다.

실험 결과

연구 질문

  • RQ1비표면적 파라미터 공유가 이질적인 다중 에이전트 환경에서 학습 성능을 떨어뜨리는가?
  • RQ2행동 유사성에 기반해 에이전트를 군집화하면 MARL에서 파라미터 공유의 효과성을 향상시킬 수 있는가?
  • RQ3전체 공유 또는 공유 없음과 비교할 때 선택적 파라미터 공유가 학습 속도와 최종 수익에 얼마나 기여하는가?
  • RQ4에이전트가 서로 다른 역할과 역학을 가질 때 SePS는 수백 명의 에이전트로도 확장 가능한가?
  • RQ5SePS는 SEAC와 같은 경험 공유 기반 베이스라인과 비교해 계산 효율성과 성능 측면에서 어떻게 다른가?

주요 결과

  • SePS는 여러 환경에서 표면적 파라미터 공유와 독립 네트워크보다 더 높은 최종 수익을 달성했다.
  • 독립 네트워크보다 훨씬 빠른 학습 속도를 기록했으며, 표본 효율성은 유지하거나 향상시켰다.
  • 비균일한 에이전트가 존재하는 환경에서는 SePS가 전체 파라미터 공유(FuPS)와 파라미터 공유 없음(NoPS)보다 수렴 속도와 최종 성능 모두에서 뛰어났다.
  • SePS는 비균일한 환경에서 최대 200명의 에이전트로 성공적으로 확장되었으며, 대규모 다중 에이전트 설정에 대한 강건성을 입증했다.
  • 행동 유사성에 기반해 에이전트 그룹을 효과적으로 식별하여, 서로 다른 역할 간의 간섭 없이 타겟팅된 파라미터 공유를 가능하게 했다.
  • SePS를 사용한 강화학습은 학습 중에 에이전트 간의 간섭이 감소했으며, 더 이상 갈등하는 공유 파라미터를 업데이트하지 않기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.