Skip to main content
QUICK REVIEW

[논문 리뷰] On the Rate of Convergence of Payoff-based Algorithms to Nash Equilibrium in Strongly Monotone Games

Tatiana Tatarenko, Maryam Kamgarpour|arXiv (Cornell University)|2022. 02. 22.
Stochastic Gradient Optimization Techniques인용 수 4
한 줄 요약

이 논문은 함수 평가(제로 오더 정보)만을 사용하여 볼록이고 강하게 단조인 게임에서 내쉬 균형을 학습하기 위한 지ay보 기반 알고리즘을 제안한다. 일점 피드백 설정에서는 $O(1/√{T})$ 수렴 속도를 확립하고, 이중점 피드백 설정에서는 $O(1/T)$ 수렴 속도를 달성하며, 반복점을 시간에 따라 변하는 스무딩 게임 균형과 비교하는 새로운 분석을 통해 이 클래스의 게임에서 가장 우수한 알려진 수렴 속도를 달성한다.

ABSTRACT

We derive the rate of convergence to Nash equilibria for the payoff-based algorithm proposed in \cite{tat_kam_TAC}. These rates are achieved under the standard assumption of convexity of the game, strong monotonicity and differentiability of the pseudo-gradient. In particular, we show the algorithm achieves $O(\frac{1}{T})$ in the two-point function evaluating setting and $O(\frac{1}{\sqrt{T}})$ in the one-point function evaluation under additional requirement of Lipschitz continuity of the pseudo-gradient. These rates are to our knowledge the best known rates for the corresponding problem classes.

연구 동기 및 목표

  • 지불 기반 학습의 수렴 속도 한계를 볼록이고 강하게 단조인 게임에서 메워내기 위해.
  • 지불 정보만을 사용하는 일점 및 이중점 함수 평가 설정 하에서 날카운 수렴 속도 유도하기 위해.
  • 알고리즘 반복점이 시간에 따라 변하는 스무딩 게임의 해와 비교하여 유도된 속도의 최적성 입증하기 위해.
  • 스무딩 게임에서 혼합 전략 균형을 고려하는 보다 정교한 분석 기법을 도입하여 이전의 $O(1/T^{1/3})$ 속도를 초월하기 위해.
  • 볼록성, 강한 단조성, 미분 가능성, 그리고 의사상수 기울기의 리프시츠 연속성이라는 표준 가정 하에서 속도를 검증하기 위해.

제안 방법

  • 지불 정보만으로 기울기를 근사하기 위해 가우시안 노이즈를 사용하는 랜덤화된 기울기 추정 전략을 사용한다.
  • 내쉬 균형이 스무딩 매개변수 $\rho_t$에 따라 변화하는 시간에 따라 변하는 스무딩 게임 모델을 도입한다.
  • 각 단계에서 알고리즘 반복점 $\bm{\mu}(t)$를 스무딩 게임의 내쉬 균형 $\mathbf{z}(t)$와 비교하여 수렴성을 분석한다.
  • 추정 오차를 통제하면서 수렴을 보장하기 위해 샘플링 분포에서 감소하는 분산 매개변수 $\sigma_t$를 활용한다.
  • 취약 확률 수렴과 거의 확실한 수렴을 확립하기 위해 찬그의 보조정리와 포트만테오 보조정리를 적용한다.
  • 최종 수렴 속도를 이끌어내기 위해 기대 제곱 거리 $\mathrm{E}[\|\bm{\mu}(t+1) - \mathbf{z}(t)\|^2]$의 경계를 유도한다.

실험 결과

연구 질문

  • RQ1지불 정보만을 사용하는 강하게 단조인 게임에서 지불 기반 알고리즘이 $O(1/T^{1/3})$ 보다 빠른 수렴 속도를 달성할 수 있는가?
  • RQ2일점 피드백 설정에서 제로 오더 확률적 기울기 방법의 수렴 속도 $O(1/\sqrt{T})$ 는 강력한 볼록 최적화 문제에서 최적이 아닌가?
  • RQ3기울기 정보에 접근할 수 없더라도 이중점 피드백 설정에서 $O(1/T)$ 수렴 속도를 달성할 수 있는가?
  • RQ4알고리즘 반복점을 시간에 따라 변하는 스무딩 게임 균형과 비교하면 진정한 균형과 직접 비교하는 것보다 더 날카운 수렴 경계를 도출할 수 있는가?
  • RQ5거의 정규 분포를 사용하는 샘플링 분포가 미러-내림 스타일 업데이트와 조합되었을 때 수렴에 어떤 영향을 미치는가?

주요 결과

  • 제안된 알고리즘은 일점 함수 평가 설정에서 $O(1/\sqrt{T})$ 수렴 속도를 달성하며, 이는 이전의 $O(1/T^{1/3})$ 속도를 향상시킨다.
  • 이중점 함수 평가 설정에서는 알고리즘이 $O(1/T)$ 수렴 속도를 달성하며, 이는 유한한 기울기 추정이 가능한 제로 오더 확률적 기울기 방법에서 최적이 된다.
  • 향상된 속도는 알고리즘 수정이 아닌, 반복점을 시간에 따라 변하는 스무딩 게임 균형과 비교하는 정교한 분석 기법 덕분이다.
  • 이중점 설정에서 $O(1/T)$ 수렴 속도는 기울기 정보가 완전히 제공되는 제로 오더 강력 볼록 최적화 문제에 대한 알려진 하한값과 일치한다.
  • 일점 설정에서 $O(1/\sqrt{T})$ 수렴 속도는 제로 오더 매끄럽고 강력한 볼록 최적화 문제에 대한 알려진 하한값과 일치하여, 주어진 가정 하에서 최적성임을 시사한다.
  • 분석은 $\sigma_t \to 0$ 라는 가정 하에 반복점이 진정한 내쉬 균형 $\bm{a}^*$로 거의 확실하게 수렴하고, 확률적으로도 수렴함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.