Skip to main content
QUICK REVIEW

[논문 리뷰] On the Convergence of Gradient-Based Learning in Continuous Games

Eric Mazumdar, Lillian J. Ratliff|arXiv (Cornell University)|2018. 04. 16.
Mathematical and Theoretical Epidemiology and Ecology Models인용 수 21
한 줄 요약

이 논문은 동역학 시스템 이론을 사용하여 연속 게임에서의 기울기 기반 학습을 분석하며, 이러한 알고리즘들이 국소 나이시 균형의 비가소한 부분집합—어떤 경우엔 전역 나이시 균형까지도—거의 확실히 피하는 것으로 보여준다. 이는 기울기 기반 학습이 GAN 훈련과 같은 제로섬 설정에서의 불안정성을 설명하는 데 사용되는 모스-스멀 게임을 도입한다.

ABSTRACT

We study the limiting behavior of competitive agents employing gradient-based learning algorithms through the lens of dynamical systems theory. Specifically, we introduce a general framework for competitive gradient-based learning that allows us to analyze a wide breadth of learning algorithms including policy gradient reinforcement learning, gradient based bandits, and certain online convex optimization algorithms. We show that for both potential games and general-sum games, when agents employ gradient-based learning algorithms, they will avoid a non-negligible subset of the local Nash equilibria. This is a strongly negative result for gradient-based learning in games. Our framework also sheds light on the issue of convergence to non-Nash strategies in general-sum and zero-sum games which have no relevance to the underlying game, and arise solely due to the choice of algorithm. The existence and frequency of strategies may explain some of the difficulties encountered when using gradient descent in zero-sum games (e.g. to train generative adversarial networks). Finally, we introduce a new class of games, Morse-Smale games, for which the gradient dynamics correspond to gradient-like flows. This class encompasses a large set of commonly encountered games. For Morse-Smale games, we show that competitive gradient-based learning converges to either limit cycles, Nash equilibria, or non-Nash fixed points almost surely. To reinforce our theoretical contributions, we provide empirical results that highlight the frequency of Nash equilibria that are almost surely avoided by policy gradient in linear quadratic games. Indeed, we present empirical results that show that policy gradient almost surely avoids the unique global Nash equilibrium in one out of five randomly sampled linear quadratic games.

연구 동기 및 목표

  • 동역학 시스템 이론을 사용하여 경쟁적 연속 게임에서의 기울기 기반 학습의 최종 행동을 이해하기 위해.
  • 일般합 및 제로섬 게임에서 기울기 기반 알고리즘이 나이시 균형으로 수렴하지 못하는 이유를 규명하기 위해.
  • 게임 이론적 해가 아니라 알고리즘적 산물인 비-나이시 고정점의 발생을 설명하기 위해.
  • 기울기 기반 동역학이 기울기 유사 흐름처럼 행동하여 더 강력한 수렴 보장을 가능하게 하는 클래스로 모스-스멀 게임을 도입하기 위해.
  • 선형 제곱 게임에서 정책 기반 강화학습이 전역 나이시 균형을 거의 확실히 피하는 빈도를 실증적으로 검증하기 위해.

제안 방법

  • 에이전트 업데이트를 연속 시간 미분방정식(ODE)으로 모델링하여 경쟁적 기울기 기반 학습을 동역학 시스템으로 공식화하기 위해.
  • 기울기 기반 동역학이 기울기 유사 흐름과 대응하는 모스-스멀 게임이라는 클래스를 정의하여 잘 조율된 동역학을 보장하기 위해.
  • 안정성 분석 및 모스 이론과 같은 동역학 시스템 도구를 적용하여 학습 알고리즘의 장기적 행동을 특성화하기 위해.
  • 잠재력 게임 및 일반합 게임에서 기울기 기반 학습 하에 나이시 균형, 한계 순환, 비-나이시 고정점으로의 수렴을 분석하기 위해.
  • 선형 제곱 게임에서의 실증적 평가를 통해 정책 기반 강화학습 하에서 전역 나이시 균형이 피워지는 빈도를 보여주기 위해.
  • 일부 균형이 불안정한 다변량에 의해 거의 확실히 피할 수 있음을 보여주는 위상적 추론을 활용하기 위해.

실험 결과

연구 질문

  • RQ1왜 경쟁적 게임에서의 기울기 기반 학습 알고리즘이 자주 나이시 균형으로 수렴하지 못하는가?
  • RQ2기울기 기반 학습에서 게임의 균형 구조와 무관하게 나타날 수 있는 고정점의 유형은 무엇인가?
  • RQ3어떤 게임 클래스에서 의미 있는 균형 또는 순환으로의 거의 확실한 수렴을 보장할 수 있는가?
  • RQ4선형 제곱 게임에서 정책 기반 강화학습이 전역 나이시 균형을 얼마나 자주 피하는가?
  • RQ5왜 GAN 훈련과 같은 제로섬 게임에서 관찰되는 불안정성은 어떤 동역학 시스템 성질에 기인하는가?

주요 결과

  • 잠재력 게임과 일반합 게임 모두에서, 기울기 기반 학습은 비가소한 국소 나이시 균형의 부분집합을 거의 확실히 피한다.
  • 비-나이시 고정점은 일반합 및 제로섬 게임에서 게임의 구조가 아니라 알고리즘 설계에 의해 발생할 수 있으며, 이는 허위 수렴을 설명한다.
  • 모스-스멀 게임에서는 기울기 기반 학습이 거의 확실히 나이시 균형, 한계 순환, 또는 비-나이시 고정점으로 수렴한다.
  • 실증 결과는 선형 제곱 게임에서 정책 기반 강화학습이 무작위로 선택된 사례의 1/5에서 전역 나이시 균형을 거의 확실히 피한다는 것을 보여준다.
  • 이 결과는 GAN 훈련과 같은 경쟁적 딥러닝 설정에서 관찰되는 불안정성과 모드 붕괴에 대한 이론적 설명을 제공한다.
  • 이 프레임워크는 균형의 불안정한 다변량이 조건이 전역적으로 최적일지라도 수렴을 방해함을 밝혀낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.