Skip to main content
QUICK REVIEW

[논문 리뷰] Nash Equilibrium Seeking in N-Coalition Games via a Gradient-Free Method

Yipeng Pang, Guoqiang Hu|arXiv (Cornell University)|2020. 08. 29.
Distributed Control Multi-Agent Systems참고 문헌 23인용 수 10
한 줄 요약

이 논문은 플레이어들이 국소 비용 함수의 명시적 그래디언트 정보에 접근할 수 없는 N-협동군 비협력 게임에 대해 이산시간, 그래디언트 기반의 내쉬 균형(Nash equilibrium, NE) 탐색 알고리즘을 제안한다. 국소 가우시안 스무딩을 통해 그래디언트 추정을 하고, 국소 그래디언트 추적을 통해 협동군 수준의 그래디언트를 집계함으로써, 강한 단조성 조건을 만족하는 게임 맵핑 하에서 NE의 이웃으로 기하수렴을 달성하며, 오차는 스텝 사이즈와 스무딩 파라미터에 의해 유계로 제한된다.

ABSTRACT

This paper studies an $N$-coalition non-cooperative game problem, where the players in the same coalition cooperatively minimize the sum of their local cost functions under a directed communication graph, while collectively acting as a virtual player to play a non-cooperative game with other coalitions. Moreover, it is assumed that the players have no access to the explicit functional form but only the function value of their local costs. To solve the problem, a discrete-time gradient-free Nash equilibrium seeking strategy, based on the gradient tracking method, is proposed. Specifically, a gradient estimator is developed locally based on Gaussian smoothing to estimate the partial gradients, and a gradient tracker is constructed locally to trace the average sum of the partial gradients among the players within the coalition. With a sufficiently small constant step-size, we show that all players' actions approximately converge to the Nash equilibrium at a geometric rate under a strongly monotone game mapping condition. Numerical simulations are conducted to verify the effectiveness of the proposed algorithm.

연구 동기 및 목표

  • 플레이어들이 국소 비용 함수의 명시적 그래디언트 정보에 접근할 수 없는 N-협동군 비협력 게임 문제를 다루기 위해.
  • 모델 지식이 필요로 하지 않는 분산형 이산시간 알고리즘을 개발하여 플레이어들이 내쉬 균형으로 수렴하도록 하기 위해.
  • 정량화 가능한 오차 한계를 갖는 진정한 NE의 이웃으로 수렴 보장하기 위해.
  • 이전에 분산 최적화에 사용된 그래디언트 추적 기법을 비협력 게임에서 내쉬 균형 탐색의 맥락으로 확장하기 위해.

제안 방법

  • 각 플레이어의 비용 함수의 편미분 그래디언트를 국소 함수 값 측정만으로 근사하기 위해 가우시안 스무딩을 사용하는 국소 그래디언트 추정기 구축.
  • 각 플레이어가 자신의 협동군 내 평균 그래디언트를 추적하는 데 사용하는 그래디언트 추적 메커니즘을 유지.
  • 기하수렴을 보장하기 위해 일정한 스텝 사이즈를 사용하며, 플레이어들이 추적된 그래디언트 정보에 기반해 자신의 행동을 갱신.
  • 보상 기반 최적화 기법과 게임이론적 균형 탐색을 통합하여, 방향성 있는 통신 그래프 하에서도 분산 구현 가능.
  • 각 협동군 내 플레이어들이 상호 협력하여 국소 비용의 합을 최소화하면서 동시에 다른 협동군들과의 비협력 게임에서 하나의 가상 플레이어로 행동.
  • 가우시안 스무딩의 강건성 덕분에 매끄럽고 비매끄러운 비용 함수 모두를 다룰 수 있도록 설계.

실험 결과

연구 질문

  • RQ1기능 값에만 접근 가능한 그래디언트 기반, 이산시간 알고리즘이 N-협동군 비협력 게임에서 내쉬 균형으로 기하수렴을 이룰 수 있는가?
  • RQ2가우시안 스무딩과 그래디언트 추적의 조합이 제한된 그래디언트 정보를 가진 게임에서 수렴 성능을 어떻게 향상시키는가?
  • RQ3스텝 사이즈와 스무딩 파라미터가 내쉬 균형 근사치의 정확도에 미치는 영향은 무엇인가?
  • RQ4제안된 방법이 방향성 있는 통신 그래프와 명시적 그래디언트 지식 없이도 수렴을 유지할 수 있는가?
  • RQ5근사 균형과 진정한 내쉬 균형 사이의 오차는 알고리즘 파라미터에 따라 어떻게 변화하는가?

주요 결과

  • 강한 단조성 게임 맵핑 조건 하에서 모든 플레이어의 행동이 내쉬 균형의 이웃으로 기하수렴한다.
  • 근사 균형과 진정한 NE 사이의 오차는 스텝 사이즈 α와 스무딩 파라미터 μ에 비례하는 항으로 유계로 제한된다.
  • 적당히 작은 일정한 스텝 사이즈를 사용할 경우, 수치 시뮬레이션을 통해 기대값 기반 선형 수렴 속도를 확보한다.
  • 스텝 사이즈와 스무딩 파라미터를 감소시킬수록 수렴 정확도가 향상되며, 이는 이론적 오차 한계를 확인한다.
  • 각 협동군에 6명의 플레이어가 있는 4-협동군 쿠르노 게임에 대한 수치 시뮬레이션 결과, 모든 플레이어의 행동이 근사적으로 내쉬 균형으로 수렴한다.
  • 다양한 스텝 사이즈에 대해 로그 스케일 플롯에서 오차 갭이 선형 감소함을 확인하여 기하수렴을 입증하였으며, 더 작은 스텝 사이즈일수록 더 높은 정확도를 얻는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.