Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Shortest Path Games and Q-Learning

Huizhen Yu|arXiv (Cornell University)|Dec 30, 2014
Risk and Portfolio Optimization参考文献 22被引用数 4
ひとこと要約

本稿は、有限状態およびコンact制御を伴う2人零和確率的最短路(SSP)ゲームの広範なクラスにおいて、Q学習の収束を確立する。対称的モデル条件を導入することで、ベルマン方程式の解の一意性とQ学習反復の有界性を保証し、弱く検証可能な仮定の下でQ学習のほとんど確実な収束を証明する。これにより、割引率なしの総コスト基準に基づくモデルフリー学習が、未割当の確率的ゲームへと拡張される。

ABSTRACT

We consider a class of two-player zero-sum stochastic games with finite state and compact control spaces, which we call stochastic shortest path (SSP) games. They are undiscounted total cost stochastic dynamic games that have a cost-free termination state. Exploiting the close connection of these games to single-player SSP problems, we introduce novel model conditions under which we show that the SSP games have strong optimality properties, including the existence of a unique solution to the dynamic programming equation, the existence of optimal stationary policies, and the convergence of value and policy iteration. We then focus on finite state and control SSP games and the classical Q-learning algorithm for computing the value function. Q-learning is a model-free, asynchronous stochastic iterative algorithm. By the theory of stochastic approximation involving monotone nonexpansive mappings, it is known to converge when its associated dynamic programming equation has a unique solution and its iterates are bounded with probability one. For the SSP case, as the main result of this paper, we prove the boundedness of the Q-learning iterates under our proposed model conditions, thereby establishing completely the convergence of Q-learning for a broad class of total cost finite-space stochastic games.

研究の動機と目的

  • 2人零和SSPゲームにおける強い最適性の性質—解の一意性、最適定常方策の存在、価値・方策反復の収束—を確立すること。
  • モデルフリーで非同期な設定下で、有限状態・コンパクト制御を伴うSSPゲームにおいてQ学習が収束するためのモデル条件を同定すること。
  • Q学習の理論的基盤を、単一エージェントMDPを超えて、総コスト基準に基づく2人確率的ゲームへと拡張すること。
  • 未割当の確率的ゲームにおける収束のための鍵となる欠落していた要因である、Q学習反復のほとんど確実な有界性を証明すること。
  • 先行研究における非対称仮定を一般化する対称的定式化を提供すること。

提案手法

  • SSPゲームにおける動的計画法方程式の解の一意性を保証する、新規の対称的モデル条件(仮定2.3)を導入する。
  • SSPゲームと単一エージェントSSP問題との関係を分析し、MDP理論における既知の収束結果を活用する。
  • 単調非拡大写像を含む確率的近似理論を用いて、Q学習の収束を分析する。
  • ベルマン作用素Fν̄の収縮性を示すために、特定の重み関数ξを用いた重み付きsupノルムを定義する。
  • Q学習反復の有界性を、隣接するSSP問題における総コスト過程と関連づけ、カップリングによる下界・上界の有界性を証明する。
  • Tsitsiklis(1994)の非同期確率的近似における収縮写像に関する結果を応用し、ほとんど確実な有界性と収束を結論づける。

実験結果

リサーチクエスチョン

  • RQ12人零和SSPゲームのベルマン方程式が一意な解を持つための条件は何か?
  • RQ2モデルフリーで非同期な学習の下で、有限状態・コンパクト制御を伴うSSPゲームにおいてQ学習は収束するか?
  • RQ3Q学習反復がほとんど確実に有界であることを保証するモデル条件は何か?
  • RQ4先行研究が制限されていた未割当の総コスト基準に基づく確率的ゲームにおいて、Q学習の収束をどのように確立できるか?
  • RQ5SSPゲーム理論における先行の非対称仮定を一般化する対称的条件は何か?

主な発見

  • 提案されたモデル条件(仮定2.3)により、SSPゲームにおける動的計画法方程式の解の一意性が保証される。
  • これらの条件下で、両プレイヤーに対して最適定常方策が存在し、価値および方策反復が収束する。
  • 提案された条件下で、Q学習反復はほとんど確実に有界である。これは収束のための重要な要件である。
  • Q学習の収束は、重み付きノルムにおけるベルマン作用素の収縮性に依拠する確率的近似理論により確立される。
  • 有界性の証明は、Q学習反復を隣接するSSP問題における総コスト過程と関連づけ、新規の重み関数ξを用いる。
  • 結果として、弱く検証可能な仮定の下で、Q学習の収束が、総コスト基準に基づく広範な2人零和確率的ゲームクラスへと拡張される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。