Skip to main content
QUICK REVIEW

[論文レビュー] Learning in games with continuous action sets and unknown payoff functions

Panayotis Mertikopoulos, Zhengyuan Zhou|arXiv (Cornell University)|Aug 25, 2016
Advanced Bandit Algorithms Research参考文献 35被引用数 5
ひとこと要約

本稿は、連続的行動集合と未知の報酬関数を有するゲームにおけるノーレグレット学習を研究し、ノイズを含む勾配推定を用いるデュアルアベーリージングアルゴリズムに注目する。変動的安定性が高確率での局所的収束を保証すること、グローバル安定性が確率1でのグローバル収束を保証することを確立し、明示的な収束速度の見積もりを提示する。

ABSTRACT

This paper examines the convergence of no-regret learning in games with continuous action sets. For concreteness, we focus on learning via "dual averaging", a widely used class of no-regret learning schemes where players take small steps along their individual payoff gradients and then "mirror" the output back to their action sets. In terms of feedback, we assume that players can only estimate their payoff gradients up to a zero-mean error with bounded variance. To study the convergence of the induced sequence of play, we introduce the notion of variational stability, and we show that stable equilibria are locally attracting with high probability whereas globally stable equilibria are globally attracting with probability 1. We also discuss some applications to mixed-strategy learning in finite games, and we provide explicit estimates of the method's convergence speed.

研究の動機と目的

  • 連続的行動集合と未知の報酬関数を有するゲームにおけるノーレグレット学習の収束を分析すること。
  • ノイズを含む報酬勾配推定が学習ダイナミクスに与える影響を研究すること。
  • 収束のための条件としての変動的安定性の概念を導入し、形式化すること。
  • グローバル変動的安定性のもとでの学習の確率1でのグローバル収束を特徴づけること。
  • 安定性仮定のもとでの学習手法の明示的な収束速度見積もりを提供すること。

提案手法

  • プレイヤーが報酬勾配の推定値に沿って小さなステップで行動を更新する、ノーレグレット学習スキームの一種であるデュアルアベーリージングを用いる。
  • 更新された行動を実行可能行動集合に戻すために「ミラー」操作を適用する。
  • 報酬勾配が平均0、有界分散のノイズを含む推定がなされると仮定する。
  • 均衡の吸引性を特徴づけるために変動的安定性の概念を導入する。
  • 確率的近似とリャプノフベースの解析を用いて収束特性を研究する。
  • 安定性条件のもとで明示的な収束速度見積もりを導出する。

実験結果

リサーチクエスチョン

  • RQ1連続的行動集合と未知の報酬関数を有するゲームにおいて、ノーレグレット学習が均衡に収束する条件は何か?
  • RQ2ノイズを含む勾配推定は、学習ダイナミクスの収束にどのように影響するか?
  • RQ3変動的安定性は、局所的またはグローバル収束を保証するために果たす役割は何か?
  • RQ4グローバル変動的安定性は、均衡への確率1収束を保証できるか?
  • RQ5安定性仮定のもとで、デュアルアベーリージング手法の明示的な収束速度は何か?

主な発見

  • ノイズを含む勾配推定を伴うデュアルアベーリージングアルゴリズムでは、安定な均衡は高確率で局所的に吸引的である。
  • グローバルに安定な均衡は確率1でグローバルに吸引的であり、確率1での収束を保証する。
  • 学習手法の収束速度が明示的に見積もりられ、定量的な性能バインディングが得られる。
  • 適切な連続的行動空間への埋め込みを通じて、有限ゲームにおける混合戦略学習にも本フレームワークが適用可能である。
  • 変動的安定性は収束の十分条件として機能し、ゲーム理論的安定性と学習ダイナミクスを結びつける。
  • 報酬勾配推定における有界分散ノイズのもとで解析が成り立つため、推定誤差に対してロバストである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。