Skip to main content
QUICK REVIEW

[논문 리뷰] Decentralized Q-Learning in Zero-sum Markov Games

Muhammed O. Sayin, Kaiqing Zhang|Lancaster EPrints (Lancaster University)|2021. 06. 04.
Reinforcement Learning in Robotics참고 문헌 66인용 수 8
한 줄 요약

이 논문은 중앙집중적 조율 없이도 나시 균형에 수렴하는 비중앙집중적 Q-학습 알고리즘을 제안한다. 에이전트들은 국소적 보상과 행동만을 사용하여 학습하며, Q-값과 가치 함수를 독립적으로 추정하는 이중 시간스케일 업데이트 규칙을 통해, 상대방의 정책이 정적일 경우 최적 반응으로 수렴하고, 양쪽 에이전트가 동일한 동역학을 사용할 경우 나시 균형으로 수렴한다.

ABSTRACT

We study multi-agent reinforcement learning (MARL) in infinite-horizon discounted zero-sum Markov games. We focus on the practical but challenging setting of decentralized MARL, where agents make decisions without coordination by a centralized controller, but only based on their own payoffs and local actions executed. The agents need not observe the opponent's actions or payoffs, possibly being even oblivious to the presence of the opponent, nor be aware of the zero-sum structure of the underlying game, a setting also referred to as radically uncoupled in the literature of learning in games. In this paper, we develop a radically uncoupled Q-learning dynamics that is both rational and convergent: the learning dynamics converges to the best response to the opponent's strategy when the opponent follows an asymptotically stationary strategy; when both agents adopt the learning dynamics, they converge to the Nash equilibrium of the game. The key challenge in this decentralized setting is the non-stationarity of the environment from an agent's perspective, since both her own payoffs and the system evolution depend on the actions of other agents, and each agent adapts her policies simultaneously and independently. To address this issue, we develop a two-timescale learning dynamics where each agent updates her local Q-function and value function estimates concurrently, with the latter happening at a slower timescale.

연구 동기 및 목표

  • 다른 에이전트의 적응 정책으로 인해 환경이 변화하는 비중앙집중적 다중에이전트 강화학습(MARL)에서의 비정적성 문제를 해결한다.
  • 에이전트가 상대방의 행동, 보상, 제로섬 구조를 알지 못하더라도 보장된 수렴성을 갖는 MARL 알고리즘을 개발한다: 에이전트는 자신의 보상, 행동, 상태만 관측한다.
  • 무한할행 할인 제로섬 마르코프 게임에서 국소 학습 동역학만을 사용하여 나시 균형으로 수렴하도록 보장한다.
  • 에이전트가 서로 존재를 모른다는 극단적 분리 조건에서도 안정성을 유지하면서 합리적인 학습 행동을 보장한다.

제안 방법

  • 에이전트가 Q-값과 가치 함수 추정치를 동시에 업데이트하는 이중 시간스케일 학습 동역학을 제안하며, 가치 함수는 더 느리게 업데이트된다.
  • 국소적 보상과 행동 관측을 통해 Q-함수와 가치 함수를 추정하며, 볼츠만 정책을 통한 탐색을 사용한다.
  • 상대방의 정책이 정적일 경우 최적 반응 전략으로 수렴하도록 시간에 따른 정책의 가중 평균을 도입한다.
  • 확률적 근사 이론을 적용하여 약한 가정 하에 수렴성을 증명하며, 상대방의 정책을 랜덤 환경으로 간주한다.
  • 상대방의 행동을 확률적 사건으로 모델링하여 랜덤 보상과 전이 동역학을 다룰 수 있도록 수렴 분석을 일반화한다.
  • 상대방 정책에 대한 지식이나 조율을 전혀 고려하지 않도록 하여 알고리즘의 비중앙집중성을 유지한다.

실험 결과

연구 질문

  • RQ1에이전트가 상대방의 행동이나 보상을 관측할 수 없을 때, 제로섬 마르코프 게임에서 비중앙집중적 Q-학습 알고리즘이 나시 균형으로 수렴할 수 있는가?
  • RQ2상대방의 정책이 비정적이고 국소적으로만 관측 가능할 경우, 어떻게 학습자가 합리적인 행동(최적 반응으로 수렴)을 이룰 수 있는가?
  • RQ3극단적 분리 조건(에이전트가 서로 존재를 모름)에서 최소한의 정보 가정 하에 수렴성을 보장하는 학습 동역학은 무엇인가?
  • RQ4이중 시간스케일 Q-학습 접근법은 동시 정책 적응으로 인한 비정적 환경에서 학습을 안정화시킬 수 있는가?
  • RQ5알고리즘이 정확한 나시 균형으로 수렴하는 조건은 무엇이며, 근접한 최적 반응 전략으로 수렴하는 조건은 언제인가?

주요 결과

  • 한 에이전트가 渐진적으로 정적 전략을 따를 경우, 다른 에이전트의 가치 함수 추정치는 거의 확실히 그 전략에 대해 달성 가능한 최대 가치로 수렴하며, 가정 1 하에 오차가 $ \epsilon \xi^i g(\gamma) $ 이내로 제한된다.
  • 더 강력한 가정(가정 2) 하에 가치 함수 추정치는 정확히 최적 반응 가치로 수렴하며, $ \lim_{k\to\infty} |\hat{v}_{s,k}^i - \max_{\pi^i} v_{\pi^i,\tilde{\pi}^{-i}}^i(s)| = 0 $ 이 거의 확실히 성립한다.
  • 정책의 가중 평균은 최적 반응 전략으로 수렴한다: 가정 1 하에 $ \limsup_{k\to\infty} \left( \max_{\pi^i} v_{\pi^i,\tilde{\pi}^{-i}}^i(s) - v_{\hat{\pi}_k^i,\tilde{\pi}^{-i}}^i(s) \right) \leq \epsilon \xi^i h(\gamma) $ 이 성립한다.
  • 양쪽 에이전트가 동일한 학습 동역학을 사용할 경우, 알고리즘은 거의 확실히 게임의 나시 균형으로 수렴한다.
  • 할인률 $ \gamma = 0.5 $ 인 20개 상태, 상태당 10개 행동의 게임에서의 시뮬레이션은 이론적 수렴을 확인하였으며, 조밀하고 복잡한 그래프가 포함된 대규모 설정에서도 성립한다.
  • 상대방의 정책이 渐진적으로 정적일 경우, 랜덤 보상과 전이 동역학 조건에서도 알고리즘이 안정성을 유지하며, 이는 이론적 프레임워크의 타당성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.