Skip to main content
QUICK REVIEW

[논문 리뷰] No-regret learning and mixed Nash equilibria: They do not mix

Lampros Flokas, Emmanouil-Vasileios Vlatakis-Gkaragkounis|arXiv (Cornell University)|2020. 10. 19.
Advanced Bandit Algorithms Research참고 문헌 59인용 수 13
한 줄 요약

이 논문은 Follow the Regularized Leader (FTRL) 기반의 no-regret 학습 동역학이 혼합 내쉬 균형을 점점 더 안정화시킬 수 없다는 것을 보여준다—오직 엄격한(순수) 내쉬 균형만이 안정한 극한점이 될 수 있다. 핵심 결과는, 적어도 한 명의 플레이어가 다수의 최적 반응을 가진다는 점에서 엄격하지 않은 내쉬 균형은 FTRL의 지ay공간에서 체적을 유지하는 성질으로 인해 FTRL 하에서 점점 더 안정해질 수 없다는 것이다. 이는 비유일한 최적 반응을 가진 혼합 전략 균형으로의 수렴을 방지한다.

ABSTRACT

Understanding the behavior of no-regret dynamics in general $N$-player games is a fundamental question in online learning and game theory. A folk result in the field states that, in finite games, the empirical frequency of play under no-regret learning converges to the game's set of coarse correlated equilibria. By contrast, our understanding of how the day-to-day behavior of the dynamics correlates to the game's Nash equilibria is much more limited, and only partial results are known for certain classes of games (such as zero-sum or congestion games). In this paper, we study the dynamics of "follow-the-regularized-leader" (FTRL), arguably the most well-studied class of no-regret dynamics, and we establish a sweeping negative result showing that the notion of mixed Nash equilibrium is antithetical to no-regret learning. Specifically, we show that any Nash equilibrium which is not strict (in that every player has a unique best response) cannot be stable and attracting under the dynamics of FTRL. This result has significant implications for predicting the outcome of a learning process as it shows unequivocally that only strict (and hence, pure) Nash equilibria can emerge as stable limit points thereof.

연구 동기 및 목표

  • 일반적인 N인자 게임에서 no-regret 학습 동역학(예: FTRL)이 내쉬 균형으로 수렴할 수 있는지 조사하기.
  • no-regret 학습이 균형으로 수렴한다는 민간 신념과 실제로 그러한 동역학 하에서 내쉬 균형의 안정성 특성 사이의 괴리를 해결하기.
  • no-regret 학습이 보장하는 조건부 상관 균형(coarse correlated equilibria)이 혼합 내쉬 균형으로의 수렴을 의미하지 않는 이유를 명확히 하기.
  • FTRL 동역학 하에서 순수 내쉬 균형과 혼합 내쉬 균형의 안정성 간의 근본적 이분화를 설정하기.
  • 기하학적 및 동역학 시스템의 논증을 사용하여 FTRL 하에서 오직 엄격한(순수) 내쉬 균형만이 점점 더 안정된 상태가 될 수 있음을 증명하기.

제안 방법

  • 지ay공간에서 FTRL 동역학을 분석하여, 이들이 기저 게임에 관계없이 르베그 측도(체적)를 유지한다는 점을 이용한다.
  • FTRL 동역학이 지이공간에서 체적을 유지한다는 사실을 이용하여, 비엄격한 혼합 내쉬 균형의 점점 더 안정성 가정에서 모순를 이끌어내기.
  • 기울기가 급격한 정규화를 사용할 경우 전략 단체의 면에 대한 정면 불변성을 적용하여 안정 집합의 가능한 위치를 제한하기.
  • 어떤 점점 더 안정된 집합도 최소 차원의 면과 교차해야 하며, 그러한 면은 단일점이어야 한다는 점을 모순을 통해 증명하기.
  • 게임 단체의 구조와 면의 상대 내부를 이용하여, 안정 집합이 비단일점 면의 내부에 있을 수 없다는 것을 보여주기.
  • 면에서 제한된 게임에서 리아프노프 안정성과 끌림 논증을 사용하여, 비단일점 면의 내부에 있는 안정 집합이 체적 유지 성질에 의해 모순을 일으킨다는 것을 보여주기.

실험 결과

연구 질문

  • RQ1일반적인 N인자 게임에서 FTRL 동역학 하에서 혼합 내쉬 균형이 점점 더 안정해질 수 있는가?
  • RQ2왜 no-regret 학습은 조건부 상관 균형으로 수렴하지만 혼합 내쉬 균형으로는 수렴하지 못하는가?
  • RQ3FTRL이 비엄격한 혼합 내쉬 균형을 안정화하지 못하게 하는 기하학적 또는 동역학적 성질은 무엇인가?
  • RQ4no-regret 학습 하에서 순수 내쉬 균형과 혼합 내쉬 균형의 안정성 간에 근본적인 차이가 존재하는가?
  • RQ5지이공간에서 FTRL의 체적 유지 성질을 사용하여 비엄격한 균형의 점점 더 안정성을 배제할 수 있는가?

주요 결과

  • 어느 한 플레이어가 다수의 최적 반응을 가진다는 점에서 엄격하지 않은 내쉬 균형은 FTRL 동역학 하에서 점점 더 안정해질 수 없다.
  • 오직 순수 내쉬 균형만이 FTRL 동역학의 점점 더 안정된 극한점이 될 수 있으며, 비유일한 최적 반응을 가진 혼합 균형은 FTRL의 지이공간에서의 체적 유지 성질을 위반하기 때문이다.
  • FTRL 동역학은 지이공간의 집합에 대한 르베그 측도를 유지한다. 이는 비엄격한 혼합 균형을 안정화시키는 데 불가능성을 뒷받침하는 핵심 성질이다.
  • FTRL 하에서 점점 더 안정된 집합은 최소 차원의 면과 교차해야 하며, 그러한 면은 단일점이어야 한다. 이는 안정된 점이 오직 순수 전략으로만 이루어져야 한다는 것을 의미한다.
  • 이 결과는 모든 기울기가 급격한 정규화를 가진 게임에 대해 성립하며, 다중 가중치와 온라인 기울기 강하를 포함한 FTRL 동역학 전체 클래스에 적용된다.
  • 논문은 광범위한 부정적 결과를 설정한다: 혼합 내쉬 균형은 FTRL 하에서 점점 더 안정성과 본질적으로 부적합하며, 이는 no-regret 학습의 장기적 결과로서 도달할 수 없다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.