Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Collaboration via Reward Attribution Decomposition

Tianjun Zhang, Huazhe Xu|arXiv (Cornell University)|2020. 10. 16.
Reinforcement Learning in Robotics참고 문헌 44인용 수 19
한 줄 요약

이 논문은 새로운 다중 에이전트 보상 할당(MARA) 손실을 통해 각 에이전트의 Q함수를 자체 및 공동 작업 항목으로 분해함으로써 탈중앙화되고 샘플 효율적인 훈련을 가능하게 하는 다중 에이전트 강화학습 방법인 협업 Q학습(CollaQ)을 제안한다. CollaQ는 동일한 환경 단계 수를 사용하여 스타크래프트 지도에서 기존 최고 성능(SOTA) 방법보다 40% 높은 승리 비율을 기록하고, 재학습 없이도 애드혹 팀 플레이에서 30% 향상된 성능을 보였다.

ABSTRACT

Recent advances in multi-agent reinforcement learning (MARL) have achieved super-human performance in games like Quake 3 and Dota 2. Unfortunately, these techniques require orders-of-magnitude more training rounds than humans and don't generalize to new agent configurations even on the same game. In this work, we propose Collaborative Q-learning (CollaQ) that achieves state-of-the-art performance in the StarCraft multi-agent challenge and supports ad hoc team play. We first formulate multi-agent collaboration as a joint optimization on reward assignment and show that each agent has an approximately optimal policy that decomposes into two parts: one part that only relies on the agent's own state, and the other part that is related to states of nearby agents. Following this novel finding, CollaQ decomposes the Q-function of each agent into a self term and an interactive term, with a Multi-Agent Reward Attribution (MARA) loss that regularizes the training. CollaQ is evaluated on various StarCraft maps and shows that it outperforms existing state-of-the-art techniques (i.e., QMIX, QTRAN, and VDN) by improving the win rate by 40% with the same number of samples. In the more challenging ad hoc team play setting (i.e., reweight/add/remove units without re-training or finetuning), CollaQ outperforms previous SoTA by over 30%.

연구 동기 및 목표

  • 스타크래프트와 같은 복잡한 환경에서 기존 다중 에이전트 강화학습(MARL) 방법의 샘플 비효율성과 낮은 일반화 능력을 해결한다.
  • 재학습이나 미세조정 없이도 새로운 팀 구성에 대해 즉각적인 일반화(애드혹 팀 플레이)를 가능하게 한다.
  • 에이전트 간 은닉된 보상 할당에 대한 공동 최적화로 다중 에이전트 협업을 공식화한다.
  • 동적 팀 구성에서도 해석 가능성과 성능를 유지하는 탈중앙화된 종단 간 훈련 가능한 알고리즘을 개발한다.

제안 방법

  • 각 에이전트의 Q함수를 두 항으로 분해한다: $Q_i^{\text{alone}}(s_i)$는 에이전트 자신의 상태에만 의존하고, $Q_i^{\text{collab}}(s_i, \mathcal{N}_i)$는 주변 에이전트의 상태에 의존한다.
  • 정규화된 DQN을 사용하여 두 항을 함께 훈련하고, 의미를 유지하기 위해 다중 에이전트 보상 할당(MARA) 손실을 적용한다.
  • 협업 항목이 관련된 맥락에서만 작동하도록, 주변에 동료가 없을 경우 $Q_i^{\text{collab}}(s_i, \cdot) = 0$ 이 되도록 강제한다.
  • 중앙집중적 훈련과 탈중앙적 실행을 활용하며, 분해가 약간 최적의 정책을 도출할 수 있는 이론적 조건을 활용한다.
  • 스타크래프트 II 다중 에이전트 챌린지에 이 분해를 적용하고, 에이전트 간 정책 공유를 위해 전문가의 혼합(mixture of experts)을 사용한다.
  • 동적 팀 설정에서의 해석 가능성과 강건성을 유지하기 위해 훈련 과정을 정규화한다.

실험 결과

연구 질문

  • RQ1다양한 팀 구성에서 최적의 공동 행동을 근사할 수 있는 탈중앙화된 Q함수를 설계할 수 있는가?
  • RQ2자기 및 공동 작업 항목으로 나누어진 보상 할당 분해가 MARL에서 샘플 효율성과 일반화 능력을 향상시키는가?
  • RQ3MARA 손실이 종단 간 훈련을 가능하게 하면서도 공동 작업 항목의 의미를 효과적으로 유지하는가?
  • RQ4이 방법이 새로운 유닛 유형이나 구성이 포함된 애드혹 팀 플레이에 얼마나 잘 일반화되는가?
  • RQ5QMIX, QTRAN, VDN과 같은 기존 SOTA 방법과 비교해 볼 때, 이 분해 방식은 해석 가능성과 성능를 얼마나 향상시키는가?

주요 결과

  • CollaQ는 동일한 환경 단계 수를 사용하여 표준 스타크래프트 지도에서 QMIX, QTRAN, VDN과 같은 기존 SOTA 방법보다 40% 높은 승리 비율을 기록했다.
  • 테스트 시점에 새로운 유닛이 추가되거나 교체되거나 제거되는 애드혹 팀 플레이 환경에서는 재학습이나 미세조정 없이도 이전 SOTA를 30% 이상 초월하는 성능을 보였다.
  • 제거 실험 결과, MARA 손실을 제거하면 성능가 급격히 악화되어, 공동 작업 항목의 의미 유지에 있어 이 손실의 핵심적 역할을 확인했다.
  • 시각화 결과, $Q_i^{\text{alone}}$와 $Q_i^{\text{collab}}$ 항목이 해석 가능하며, 관련된 동료가 존재할 때만 공동 작업 항목이 활성화됨을 확인했다.
  • 이 방법은 새로운 팀 구성에 효과적으로 일반화되어, 복잡하고 실제 세계 유사 환경에서 즉각적 적응 능력을 보였다.
  • CollaQ의 전문가 혼합 구성 요소는 동일한 설정에서 QMIX를 크게 능가하는 성능 향상을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.