Skip to main content
QUICK REVIEW

[논문 리뷰] Regularized Softmax Deep Multi-Agent $Q$-Learning

Ling Pan, Tabish Rashid|arXiv (Cornell University)|2021. 03. 22.
Reinforcement Learning in Robotics참고 문헌 42인용 수 16
한 줄 요약

이 논문은 기준값 기반 정규화 기법과 소프트맥스 연산자의 효율적 근사치를 조합하여 다중 에이전트 Q-학습에서 과대추정을 줄이는 일반적인 방법인 정규화된 소프트맥스(RES) 딥 다중 에이전트 Q-학습을 제안한다. QMIX에 적용했을 때 학습을 안정화시키고 무한대에 수렴하는 가치 추정을 방지하며, 스타크래프트 II 미크로매니지먼트 작업과 다중 에이전트 입자 환경에서 최신 기술 수준 성능을 달성한다.

ABSTRACT

Tackling overestimation in $Q$-learning is an important problem that has been extensively studied in single-agent reinforcement learning, but has received comparatively little attention in the multi-agent setting. In this work, we empirically demonstrate that QMIX, a popular $Q$-learning algorithm for cooperative multi-agent reinforcement learning (MARL), suffers from a more severe overestimation in practice than previously acknowledged, and is not mitigated by existing approaches. We rectify this with a novel regularization-based update scheme that penalizes large joint action-values that deviate from a baseline and demonstrate its effectiveness in stabilizing learning. Furthermore, we propose to employ a softmax operator, which we efficiently approximate in a novel way in the multi-agent setting, to further reduce the potential overestimation bias. Our approach, Regularized Softmax (RES) Deep Multi-Agent $Q$-Learning, is general and can be applied to any $Q$-learning based MARL algorithm. We demonstrate that, when applied to QMIX, RES avoids severe overestimation and significantly improves performance, yielding state-of-the-art results in a variety of cooperative multi-agent tasks, including the challenging StarCraft II micromanagement benchmarks.

연구 동기 및 목표

  • 기존 연구에서 간과된 QMIX에서 특히 심각한 과대추정 문제를 해결하기 위해.
  • 합동 행동 가치 추정치의 무한대 성장을 방지함으로써 학습을 안정화시켜 성능 저하를 막기 위해.
  • 더블 추정기나 기존 정규화 기법이 달성할 수 없는 수준의 과대추정 편향을 줄이기 위해.
  • MARL에서 큰 합동 행동 공간을 가진 경우에도 효율적이고 확장 가능한 소프트맥스 연산자 근사치를 개발하기 위해.
  • QMIX에 국한되지 않고 Q-학습 기반의 모든 다중 에이전트 강화학습 알고리즘에 적용 가능한 일반적인 방법을 개발하기 위해.

제안 방법

  • 기준값으로 할인 수익을 사용하여 합동 행동 Q-값이 기준에서 벗어나는 것을 방지하는 정규화 기반 업데이트를 도입하여 학습을 안정화시킨다.
  • 합동 행동 하위공간에서 작동하는 새로운 효율적 소프트맥스 연산자 근사치를 활용하며, 역 온도 파라미터에 따라 지수적 속도로 진짜 소프트맥스로 수렴한다.
  • 정규화 페널티와 소프트맥스 근사치를 통합한 수정된 벨먼 손실을 유도하여 과대추정 편향을 줄인다.
  • 소프트맥스 근사치에서 온도 파라미터를 사용하여 탐색과 이용 간의 균형을 제어한다.
  • 표준 Q-학습 업데이트를 RES 업데이트 규칙으로 교체함으로써 QMIX에 이 방법을 적용하며, 단조적 혼합 네트워크 구조를 유지한다.
  • 전체 합동 행동 공간을 나열하지 않고도 효율적으로 소프트맥스 근사치를 계산하기 위해 하위공간 기반 샘플링 전략을 사용한다.

실험 결과

연구 질문

  • RQ1QMIX는 더블 DQN과 클리프드 더블 Q-학습을 사용하고 있음에도 불구하고 실무에서 심각한 과대추정 문제를 겪는 이유는 무엇인가?
  • RQ2기존 단일 에이전트 과대추정 완화 기법들, 예를 들어 더블 추정기나 소프트맥스 기법이 다중 에이전트 환경에 효과적으로 적용될 수 있는가?
  • RQ3에이전트 수가 증가함에 따라 기하급수적으로 증가하는 합동 행동 공간에서 합동 행동 가치 함수의 과대추정을 어떻게 안정화시킬 수 있는가?
  • RQ4기준값에서의 이탈을 방지하는 정규화 기법이 다중 에이전트 강화학습에서 학습 안정성과 성능 향상에 기여할 수 있는가?
  • RQ5큰 다중 에이전트 행동 공간에서 정확도를 유지하면서도 효율적이고 확장 가능한 소프트맥스 연산자 근사치가 존재하는가?

주요 결과

  • RES-QMIX는 QMIX의 가치 추정치가 발산하고 성능이 붕괴되는 다중 에이전트 입자 환경에서 무한대 가치 성장을 완전히 제거한다.
  • 시험된 모든 스타크래프트 II 미크로매니지먼트 지도에서 RES-QMIX는 QMIX, QPLEX 및 기타 최신 기술 수준 기준선을 능가하는 최신 기술 수준 성능을 달성한다.
  • 더블 추정기를 사용하지 않더라도, RES-QMIX(단일)는 모든 지도에서 표준 QMIX와 더블 추정기를 사용한 QMIX를 모두 능가하며, 정규화 기법 자체의 효과성을 입증한다.
  • RES-QMIX의 가치 추정치는 QMIX보다 훨씬 작고 안정적이며, 과대추정 편향 감소가 검증됨을 확인한다.
  • 제안된 소프트맥스 근사치는 역 온도 파라미터에 따라 지수적 속도로 진짜 소프트맥스로 수렴하여 낮은 계산 비용으로도 높은 정확도를 유지한다.
  • 이 방법은 잘 일반화된다: RES는 QMIX에 국한되지 않고 Q-학습 기반의 모든 다중 에이전트 강화학습 알고리즘에 적용 가능하며, 다양한 환경에서 성능 향상이 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.