Skip to main content
QUICK REVIEW

[논문 리뷰] Cooperative Multi-Agent Transfer Learning with Level-Adaptive Credit Assignment

Tianze Zhou, Fubiao Zhang|arXiv (Cornell University)|2021. 06. 01.
Reinforcement Learning in Robotics참고 문헌 33인용 수 10
한 줄 요약

이 논문은 협동적 다중에이전트 강화학습을 위한 혁신적인 프레임워크를 제안하며, 수준 적응형 트랜스포머 아키텍처와 전용 믹싱 네트워크(LA-QTransformer)를 통해 조율 지식의 강건한 전이를 가능하게 한다. 다중에이전트 조율을 적응형, 에이전트별 패턴으로 분해하고, 인구수에 관계없이 적용 가능한 에이전트 설계(PIT)를 사용함으로써, 이 방법은 스타크래프트 II 마이크로 관리 작업에서 최신 기술(SOTA) 성능을 달성하여 전이 및 비전이 시나리오 모두에서 기존 베이스라인을 능가한다.

ABSTRACT

Extending transfer learning to cooperative multi-agent reinforcement learning (MARL) has recently received much attention. In contrast to the single-agent setting, the coordination indispensable in cooperative MARL constrains each agent's policy. However, existing transfer methods focus exclusively on agent policy and ignores coordination knowledge. We propose a new architecture that realizes robust coordination knowledge transfer through appropriate decomposition of the overall coordination into several coordination patterns. We use a novel mixing network named level-adaptive QTransformer (LA-QTransformer) to realize agent coordination that considers credit assignment, with appropriate coordination patterns for different agents realized by a novel level-adaptive Transformer (LA-Transformer) dedicated to the transfer of coordination knowledge. In addition, we use a novel agent network named Population Invariant agent with Transformer (PIT) to realize the coordination transfer in more varieties of scenarios. Extensive experiments in StarCraft II micro-management show that LA-QTransformer together with PIT achieves superior performance compared with state-of-the-art baselines.

연구 동기 및 목표

  • 기존 전이 학습 방법의 한계를 해결하기 위해, 에이전트 정책 전이에만 초점을 맞추고 조율 지식을 忽시하는 문제를 해결한다.
  • 에이전트 인구수와 조율 패턴이 다양할 경우에도 강건한 조율 지식 전이를 가능하게 한다.
  • 동적 에이전트 인구수를 지원하고 다양한 시나리오에서 성능를 유지하는 확장 가능하고 일반화 가능한 아키텍처를 개발한다.
  • 새로운 믹싱 네트워크를 통해 다수 수준의 조율 패턴을 명시적으로 모델링하여, 가치 기반 다중에이전트 강화학습에서의 신용 할당을 향상시킨다.
  • 다양한 수의 에이전트에 걸쳐 조율 지식을 일반화할 수 있는 인구수에 관계없는 에이전트 구조를 설계한다.

제안 방법

  • 하드 어텐션 또는 하이브리드 특징 융합을 사용하여 각 에이전트에 대해 적절한 조율 수준(예: 쌍, 삼중)을 동적으로 식별하고 집중하는, 수준 적응형 트랜스포머(LA-Transformer)를 도입한다.
  • LA-Transformer의 조율 패턴을 통합하여 가치 기반 다중에이전트 강화학습에서 강건한 신용 할당을 가능하게 하는, 새로운 믹싱 네트워크인 수준 적응형 QTransformer(LA-QTransformer)를 설계한다.
  • 엔터티 수준 특징에 대한 어텐션 메커니즘을 활용하여 다양한 에이전트 수에 걸쳐 조율 지식을 일반화하는, 새로운 에이전트 네트워크 아키텍처인 인구수에 관계없는 트랜스포머(PIT)를 제안한다.
  • 전역 조율을 재사용 가능한 조율 패턴으로 분해하여, 개별 정책을 초월한 구조적 조율 지식 전이를 가능하게 한다.
  • 에이전트 수를 점차 증가시키는 커리큘럼 훈련을 통해 강건성과 조율 패턴 학습 향상을 검증한다.
  • 단조성 제약 조건을 만족시키고 효과적인 공동 Q-값 추정을 가능하게 하는 LA-QTransformer를 통해 신용 할당을 구현한다.

실험 결과

연구 질문

  • RQ1다양한 에이전트 인구수를 가진 협동적 다중에이전트 작업 간에 조율 패턴을 효과적으로 분해하고 전이할 수 있는가?
  • RQ2적응형, 수준별 조율 패턴을 지원하면서도 적절한 신용 할당을 보장할 수 있는 믹싱 네트워크는 어떻게 설계할 수 있는가?
  • RQ3인구수에 관계없는 에이전트 아키텍처가 다양한 수의 에이전트 간에 조율 지식을 어느 정도 일반화할 수 있는가?
  • RQ4조율 패턴을 명시적으로 모델링하는 것이, 종단간 정책 전이에 비해 협동적 다중에이전트 강화학습에서 더 나은 전이 성능을 이끌어낼 수 있는가?
  • RQ5커리큘럼 학습은 복잡한 다중에이전트 환경에서 조율 패턴의 발견과 활용을 향상시킬 수 있는가?

주요 결과

  • 하이브리드 어텐션을 사용한 LA-QTransformer는 스타크래프트 II 5m(3m) 지ap에서 97.1%의 승리율을 기록하여 QMIX(95.3%)와 LA-QTransformer(하드)(97.1%)를 능가했다.
  • 5m6m(8m9m) 시나리오에서는 LA-QTransformer(하이브리드)가 97.1%의 승리율을 기록하여 QMIX(96.1%)와 LA-QTransformer(하드)(96.9%)를 크게 앞섰다.
  • 5m6m(8m9m) 지도에서 사전 훈련 없이도 83.2%의 승리율을 기록하여 강력한 일반화 능력과 강건성을 입증했다.
  • 아블레이션 연구에서 표준 트랜스포머를 다중으로 스택하는 것은 성능 향상을 이끌지 못한 반면, LA-Transformer는 최적의 조율 수준을 명시적으로 포착함을 확인했다.
  • PIT 에이전트 설계는 커리큘럼 훈련을 통해 증가하는 인구수를 기반으로 다양한 에이전트 수 간의 효과적인 조율 지식 전이를 가능하게 했다.
  • 해석 가능성 분석에서 LA-Transformer는 스타크래프트 II에서 쌍, 삼중 형성과 같은 관련 있는 조율 패턴을 성공적으로 식별하고 활용하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.