Skip to main content
QUICK REVIEW

[論文レビュー] Finite-Time Last-Iterate Convergence for Multi-Agent Learning in Games

Tianyi Lin, Zhengyuan Zhou|arXiv (Cornell University)|Feb 23, 2020
Reinforcement Learning in Robotics参考文献 17被引用数 6
ひとこと要約

本稿は、強い単調性ゲームを一般化する多エージェントゲームの広いクラスである$λ$-共 coerciveゲームにおけるオンライン勾配降下法(OGD)について、有限時間内での最後の反復収束レートを確立する。本稿では、共 coercivity定数$λ$の知識を必要とせず、同一の収束速度を達成する完全に適応的なOGDアルゴリズムを導入し、新しい二重ストップタイム技術を用いる。また、非減少ステップサイズを伴うノイズのあるフィードバックに対しても結果を拡張する。

ABSTRACT

In this paper, we consider multi-agent learning via online gradient descent in a class of games called $λ$-cocoercive games, a fairly broad class of games that admits many Nash equilibria and that properly includes unconstrained strongly monotone games. We characterize the finite-time last-iterate convergence rate for joint OGD learning on $λ$-cocoercive games; further, building on this result, we develop a fully adaptive OGD learning algorithm that does not require any knowledge of problem parameter (e.g. cocoercive constant $λ$) and show, via a novel double-stopping time technique, that this adaptive algorithm achieves same finite-time last-iterate convergence rate as non-adaptive counterpart. Subsequently, we extend OGD learning to the noisy gradient feedback case and establish last-iterate convergence results -- first qualitative almost sure convergence, then quantitative finite-time convergence rates -- all under non-decreasing step-sizes. To our knowledge, we provide the first set of results that fill in several gaps of the existing multi-agent online learning literature, where three aspects -- finite-time convergence rates, non-decreasing step-sizes, and fully adaptive algorithms have been unexplored before.

研究の動機と目的

  • 多エージェント学習における最後の反復収束について、有限時間収束速度保証が不足している問題に対処する。特に、オンライン勾配降下法(OGD)を対象とする。
  • 非減少ステップサイズおよび完全に適応的なアルゴリズムの下での最後の反復収束を分析することで、文献における重要なギャップを埋める。
  • $λ$-共 coerciveゲームにおけるOGDの定量的収束速度を確立する。このクラスは強い単調性ゲームを一般化し、複数のナッシュ均衡を許容する。
  • ノイズのある勾配フィードバックに対し、解析を拡張し、定性的な確実収束と定量的有限時間レートの両方を提供する。
  • 共 coercivity定数$λ$のような問題パラメータの事前知識が不要な、完全に適応的なOGDアルゴリズムを設計する。このアルゴリズムは、非適応的バージョンと同一の収束速度を達成する。

提案手法

  • unconstrainedな強い単調性ゲームを適切に含み、複数のナッシュ均衡を許容する広いクラスとして、$λ$-共 coerciveゲームを定義する。
  • $λ$-共 coerciveゲームにおける連携的OGD学習を分析し、新しい二重ストップタイム技術を用いて、有限時間内での最後の反復収束速度を導出する。
  • 共 coercivity定数$λ$の知識を必要とせず、ステップサイズを動的に調整する完全に適応的なOGDアルゴリズムを提案する。
  • リャプノフスタイルの解析を用いて、時間経過に伴う均衡からの距離を測る量である期待誤差$\|\mathbf{v}(\mathbf{x}_t)\|^2$の上界を求める。
  • ストップタイムを用いて期待誤差の成長を制御することで、適応的アルゴリズムが非適応的バージョンと同一の有限時間収束速度を達成することを確立する。
  • 非減少ステップサイズ下でのノイズのあるフィードバックに対し、解析を拡張し、期待誤差の上界を評価する。これにより、確実収束と有限時間レートの両方を証明する。

実験結果

リサーチクエスチョン

  • RQ1 $λ$-共 coerciveゲームにおけるOGDについて、有限時間内での最後の反復収束速度を確立できるか。これは多エージェントゲームの広いクラスである。
  • RQ2 $λ$の事前知識が不要な、非適応的バージョンと同一の収束速度を達成する完全に適応的なOGDアルゴリズムを設計できるか。
  • RQ3 非減少ステップサイズを伴うOGDが、ノイズのある勾配フィードバック下でも$λ$-共 coerciveゲームで最後の反復収束を達成できるか。
  • RQ4 ノイズのあるフィードバックと非減少ステップサイズを伴う$λ$-共 coerciveゲームにおけるOGDの定量的有限時間収束速度は何か。
  • RQ5 二重ストップタイム技術を用いて、この設定下での適応的OGDの有限時間収束を確立できるか。

主な発見

  • 本稿は、$λ$-共 coerciveゲームにおける連携的OGDについて、適切な条件下で誤差が$O(\sqrt{\log T}/T)$の速度で減少することを確立する。
  • 共 coercivity定数$λ$の知識が不要であり、非適応的バージョンと同一の有限時間収束速度を達成する完全に適応的なOGDアルゴリズムを提案する。
  • 適応的アルゴリズムの収束は、期待誤差の成長を制御する新しい二重ストップタイム技術を用いて証明される。
  • ノイズのあるフィードバックに対しては、非減少ステップサイズ下で、定性的な確実収束と定量的有限時間収束速度の両方を確立する。
  • 期待誤差$\mathbb{E}[\|\mathbf{v}(\mathbf{x}_t)\|^2]$は、普遍定数$C_1, C_2 > 0$に対して$C_1 + C_2\sqrt{\log(T+1)}$で上界が与えられ、これにより有限時間レート解析が可能になる。
  • 分析により、$\mathbb{E}[\epsilon(\mathbf{x}_T)] \leq \frac{\sum_{t=t_1^*}^T \mathbb{E}[\epsilon(\mathbf{x}_t)]}{T - t_1^* + 1} + \frac{C \log(T+1)}{\lambda(T - t_1^* + 1)} \sum_{t=0}^{T-1} \tau_t$が成り立ち、期待誤差に対して$O(\log T / T)$のレートが得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。