Skip to main content
QUICK REVIEW

[論文レビュー] A Tauberian theorem for nonexpansive operators and applications to zero-sum stochastic games

Bruno Ziliotto|arXiv (Cornell University)|Jan 26, 2015
Economic theories and models参考文献 23被引用数 6
ひとこと要約

本稿は、非拡大作用素に対する一般化されたタウバーレン定理を確立し、ゼロサム確率ゲームにおけるn段階ゲーム価値$v_n$の一様収束が、$\lambda \to 0$における$\lambda$割引ゲーム価値$v_\lambda$の一様収束と同値であることを証明している。主な貢献は、公的状態信号を有する有限状態・有限行動・有限信号の確率ゲームにおいて、$v_\lambda(k_1)$と$v_n(k_1)$が異なる極限に収束する初の例を提供したことである。これは、確率ゲーム理論における長年の未解決問題を解決するものである。

ABSTRACT

We prove a Tauberian theorem for nonexpansive operators, and apply it to the model of zero-sum stochastic game. Under mild assumptions, we prove that the value of the lambda-discounted game v_{lambda} converges uniformly when lambda goes to 0 if and only if the value of the n-stage game v_n converges uniformly when n goes to infinity. This generalizes the Tauberian theorem of Lehrer and Sorin (1992) to the two-player zero-sum case. We also provide the first example of a stochastic game with public signals on the state and perfect observation of actions, with finite state space, signal sets and action sets, in which for some initial state k_1 known by both players, (v_{lambda}(k_1)) and (v_n(k_1)) converge to distinct limits.

研究の動機と目的

  • リーラーとソリンのタウバーレン定理を単一コントローラーから2人ゼロサム確率ゲームへ一般化すること。
  • 一般の確率ゲームにおいて、$v_n$の一様収束が$v_\lambda$の一様収束を意味するか、逆にその逆が成り立つかという未解決問題を解明すること。
  • 公的状態信号と完全な行動観測を備えた有限ホライズン確率ゲームにおいて、$v_\lambda(k_1)$と$v_n(k_1)$が異なる極限に収束する初の例を構築すること。
  • 異なる評価基準下でのゲーム価値の収束を分析するための一般枠組みを、非拡大作用素を用いて確立すること。

提案手法

  • 有界関数に作用する非拡大作用素に対するタウバーレン定理を証明し、離散時間平均と連続時間平均の漸近的挙動を結びつける。
  • 作用素論的アプローチをシャープレー方程式に適用し、確率ゲームにおける動的計画法作用素の非拡大性を活用する。
  • 有限状態・行動・信号集合を持つ隠れ確率ゲームを構築し、再帰的状態遷移と信念ダイナミクスを用いて、極限が分離する状況を創出する。
  • 3段階の構成法を用いる:第一に、$v_n(k_1)$が$>2/3$に収束し、$v_\lambda(k_1)$が$1/2$に収束するゲーム;第二に、対称的なゲームで同様の性質を有するもの;第三に、両者を組み合わせたハイブリッドゲーム。
  • 最終的なゲームでは、プレイヤー2が、$v_\lambda$による長期間ゲーム(価値$1/2$)か、$v_n$による恒久的報酬$x > 1/2$のどちらかを選べるよう設計され、収束挙動の差を活用する。
  • $\lambda$が小さい場合には$v_\lambda$が長期間ゲームを優遇するが、$n$が大きい場合には$v_n$が即時報酬を優遇するという事実を活用し、極限が異なることを保証する。

実験結果

リサーチクエスチョン

  • RQ12人ゼロサム確率ゲームにおいて、$n$段階ゲーム価値$v_n$の一様収束は、$\lambda$割引ゲーム価値$v_\lambda$の一様収束を意味するか?
  • RQ2逆に、$v_\lambda$の一様収束は$v_n$の一様収束を意味するか?
  • RQ3有限状態・行動・信号集合を持つ確率ゲームにおいて、初期状態$k_1$に対して$v_\lambda(k_1)$と$v_n(k_1)$が異なる極限に収束することは可能か?
  • RQ4どのような条件下で$v_n$と$v_\lambda$の極限が一致し、どのような条件下で分離するか?
  • RQ5非拡大作用素を用いて、確率ゲーム価値に対するタウバーレン定理をどのように導出できるか?

主な発見

  • 本稿では、やや緩い条件下でも、2人ゼロサム確率ゲームにおいて、$v_n$が一様収束することと$v_\lambda$が一様収束することは同値であることを証明している。
  • 一様収束が成立する場合、$v_n$と$v_\lambda$の極限は等しくなる。これは、リーラーとソリンの結果を2人ゲームに一般化したものである。
  • 本稿では、公的状態信号と完全な行動観測を備えた有限ホライズン確率ゲームを構築し、$v_\lambda(k_1)$が$1/2$に収束し、$v_n(k_1)$が$x > 1/2$に収束することを示した。これにより、異なる極限が実現されることを実証した。
  • この例は3段階の構成法により構築された:第一に、$\liminf v_n(k_1) > 2/3$かつ$v_\lambda(k_1) \to 1/2$となるゲーム;第二に、対称的なゲーム;第三に、プレイヤー2が長期間ゲームと即時報酬のどちらを選ぶかを決定できるハイブリッドゲーム。
  • 最終的なゲームでは、$\lim_{\lambda \to 0} v_\lambda(\omega_4) = 1/2$かつ$\lim_{n \to \infty} v_n(\omega_4) = x > 1/2$であることが示され、異なる極限の存在を証明した。
  • この結果により、一般の確率ゲームにおいて、一様収束が極限の等価性を保証するわけではないことが示された。たとえ有限構造を有しても同様である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。