Skip to main content
QUICK REVIEW

[논문 리뷰] Influencing Long-Term Behavior in Multiagent Reinforcement Learning

Dong Ki Kim, Matthew Riemer|arXiv (Cornell University)|2022. 03. 07.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 다중에이전트 강화학습을 위한 사고력 있는 프레임워크인 FURTHER를 제안한다. FURTHER는 다른 에이전트의 수렴 행동에 대한 장기적 영향을 모델링하여 에이전트의 정책을 최적화한다. 활성 마르코프 게임로 공식화하고, 변분 추론을 사용한 정책 그래เดียน트 방법을 통해 다양한 다중에이전트 강화학습 환경에서 단기적 기준에 비해 뛰어난 장기적 성능을 달성하며, 더 바람직한 균형에 일관되게 수렴한다.

ABSTRACT

The main challenge of multiagent reinforcement learning is the difficulty of learning useful policies in the presence of other simultaneously learning agents whose changing behaviors jointly affect the environment's transition and reward dynamics. An effective approach that has recently emerged for addressing this non-stationarity is for each agent to anticipate the learning of other agents and influence the evolution of future policies towards desirable behavior for its own benefit. Unfortunately, previous approaches for achieving this suffer from myopic evaluation, considering only a finite number of policy updates. As such, these methods can only influence transient future policies rather than achieving the promise of scalable equilibrium selection approaches that influence the behavior at convergence. In this paper, we propose a principled framework for considering the limiting policies of other agents as time approaches infinity. Specifically, we develop a new optimization objective that maximizes each agent's average reward by directly accounting for the impact of its behavior on the limiting set of policies that other agents will converge to. Our paper characterizes desirable solution concepts within this problem setting and provides practical approaches for optimizing over possible outcomes. As a result of our farsighted objective, we demonstrate better long-term performance than state-of-the-art baselines across a suite of diverse multiagent benchmark domains.

연구 동기 및 목표

  • 동시에 학습하는 에이전트의 행동이 상호 영향을 주고받는다는 점에서 발생하는 비정상성 문제를 해결하기 위해.
  • 시간이 무한에 가까워질 때 다른 에이전트의 수렴 정책을 예측하고 영향을 미치는 프레임워크를 체계화하기 위해.
  • 다른 에이전트의 수렴 행동에 미치는 영향을 고려하여 평균 장기 보상을 최대화하는 실용적인 최적화 방법을 개발하기 위해.
  • 단기적 또는 영향력이 없는 방법에 비해 사고력 있는 영향력이 더 나은 균형 선택을 이끌 수 있음을 입증하기 위해.
  • 변분 추론과 특화된 벨먼 업데이트를 통해 분산된 학습과 실행을 가능하게 하기 위해.

제안 방법

  • 비정상성을 joint policy 업데이트의 유도 그래픽 모델로 모델링하는 활성 마르코프 게임으로 다중에이전트 학습을 체계화한다.
  • 다른 에이전트의 수렴 정책의 극한 분포에 대한 평균 보상을 최대화하는 새로운 최적화 목표를 도입한다.
  • 활성 마르코프 게임에 적합한 맞춤형 벨먼 업데이트 규칙을 사용하는 정책 그래디언트 기반 알고리즘인 FURTHER를 개발한다.
  • 다른 에이전트의 정책 업데이트 함수를 근사하기 위해 변분 추론을 사용하여 분산 실행과 학습을 가능하게 한다.
  • 대규모 다중에이전트 환경에 적합하도록 평균장 방법을 통합한다.
  • 장기적 수렴 메타학습을 가능하게 하기 위해 자기 자신에 대한 정책은 고정된 정적 정책으로 가정한다.

실험 결과

연구 질문

  • RQ1다중에이전트 시스템의 에이전트들이 다른 학습 중인 에이전트의 장기적 행동에 효과적으로 영향을 줄 수 있는 방법은 무엇인가?
  • RQ2다중에이전트 강화학습에서 유한한 수평의 근사치 대비 무한 수평의 정책 수렴을 고려할 경우 어떤 영향을 미치는가?
  • RQ3사고력 있는 최적화 목표가 단기적 또는 영향력이 없는 방법에 비해 더 나은 균형 선택을 이끌 수 있는가?
  • RQ4이 프레임워크는 협력적, 경쟁적, 혼합된 설정을 포함한 다양한 다중에이전트 벤치마크 환경에서 어떻게 성능을 발휘하는가?
  • RQ5변분 추론은 장기적 영향을 모델링하면서도 분산된 학습을 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • FURTHER는 IBS, IC, IMP, RoboSumo, Battle 등 다양한 다중에이전트 강화학습 환경에서 최첨단 기준보다 뛰어난 장기 평균 보상을 지속적으로 달성한다.
  • IBS 게임에서 FURTHER는 최적의 순수 전략 나시 균형에 성공적으로 수렴하지만, 기준 기법들은 이를 달성하지 못한다.
  • IMP와 같은 경쟁적 환경에서는 FURTHER가 MOA 및 DRON과 같은 단기적 기준 기법들을 능가하며, 그들의 시야 부족으로 인해 쉽게 약점이 드러나는 것을 방지한다.
  • 특히 대규모 설정에서 평균장 근사와 결합했을 때 프레임워크는 뛰어난 강건성과 확장성을 보여준다.
  • 자기 대결 및 협력적 상황에서 FURTHER는 기준 기법보다 더 나은 수렴 성능을 달성한다.
  • 다양한 하이퍼파rameter 설정에서도 성능이 안정적이며, 평균 보상과 수렴 품질에서 일관된 성과 향상을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.