Skip to main content
QUICK REVIEW

[論文レビュー] Structure in the Value Function of Two-Player Zero-Sum Games of Incomplete Information

Auke Wiggers, Frans A. Oliehoek|arXiv (Cornell University)|Jun 22, 2016
Decision-Making and Behavioral Economics参考文献 16被引用数 4
ひとこと要約

本稿は、2人零和部分的に観測可能な確率的ゲーム(zs-POSGs)における過去の連携方策を表現するための計画時十分統計量 σt を提案する。これにより、後退帰納法を用いた合理的な意思決定が可能になる。価値関数 V*t(σt) がエージェント1のマージナルタイプ分布においては凹型であり、エージェント2においては凸型であることを証明し、不完全情報下の複雑な逐次意思決定問題に対する効率的な解法手法に構造的利点を提供する。

ABSTRACT

Zero-sum stochastic games provide a rich model for competitive decision making. However, under general forms of state uncertainty as considered in the Partially Observable Stochastic Game (POSG), such decision making problems are still not very well understood. This paper makes a contribution to the theory of zero-sum POSGs by characterizing structure in their value function. In particular, we introduce a new formulation of the value function for zs-POSGs as a function of the "plan-time sufficient statistics" (roughly speaking the information distribution in the POSG), which has the potential to enable generalization over such information distributions. We further delineate this generalization capability by proving a structural result on the shape of value function: it exhibits concavity and convexity with respect to appropriately chosen marginals of the statistic space. This result is a key pre-cursor for developing solution methods that may be able to exploit such structure. Finally, we show how these results allow us to reduce a zs-POSG to a "centralized" model with shared observations, thereby transferring results for the latter, narrower class, to games with individual (private) observations.

研究の動機と目的

  • 不完全情報下の2人零和POSGにおける過去の連携方策を表現する課題に対処すること。
  • 将来の段階における合理的な意思決定に必要な歴史的情報をすべて捉える十分統計量 σt を定義すること。
  • 価値関数 V*t(σt) がマージナルタイプ空間において凹型/凸型構造を示すことを確立し、効率的な最適化を可能とすること。
  • 連続的かつ高次元的な十分統計量空間であるにもかかわらず、zs-POSGにおける後退帰納法の基盤を提供すること。
  • σt が価値計算に十分であることを形式的に検証し、協調的Dec-POMDPsにおける概念を零和設定へ一般化すること。

提案手法

  • 初期信念 b0 と過去の連携方策 φt を前提とした場合の、連携AOHsの事後分布を表す計画時十分統計量 σt(→θt) = Pr(→θt|b0, φt) を導入する。
  • σt の更新ルールを定義する:σt+1(→θδt+1) ∝ Pr(o t+1 | →θδt, a t) · δt(a t | →θδt) · σt(→θδt)。
  • 十分統計量を用いてQ値関数 Q*t(σt, →θδt, δt) を再定式化し、最終段階のQ値は即時の報酬 R(→θδt, δt) に等しい。
  • max-min最適化を用いて合理的な意思決定ルールを導出する:δt+1*1 = argmaxδ1t+1∈Δ1S minδ2t+1∈Δ2S Q*t+1(σt+1, ⟨δ1t+1, δ2t+1⟩),エージェント2に対しても同様に定義する。
  • σt が価値計算に十分であることを証明する:Q*t(σt, →θt, δt) = Q*t(φt, →θt, δt) であり、過去の方策からの情報損失がないことを保証する。
  • 価値関数 V*t(σt) が Δ(→Θ1t) において凹型であり、Δ(→Θ2t) において凸型であることを確立し、最終段階における零和ベイジアンゲームの族から得られる構造を活用する。

実験結果

リサーチクエスチョン

  • RQ12人零和POSGにおけるすべての過去の連携方策の影響を捉える計画時十分統計量 σt を定義できるか?
  • RQ2σt が最適価値関数 Q*t(σt, →θt, δt) の計算に十分であるか、情報損失なしに成立するか?
  • RQ3価値関数 V*t(σt) が2人のエージェントのマージナルタイプ分布において凹型/凸型構造を示すか?
  • RQ4この構造的性質を活用して、連続的かつ高次元的な統計量であるにもかかわらず、zs-POSGにおける効率的な後退帰納法を可能とするか?
  • RQ5最終段階の価値関数は零和ベイジアンゲームの族とどのように関係するか?どのような構造的性質が生じるか?

主な発見

  • 計画時十分統計量 σt が、価値計算に十分であることが形式的に証明された。すなわち、すべての t, →θt, δt に対して Q*t(σt, →θt, δt) = Q*t(φt, →θt, δt) が成り立つ。
  • 価値関数 V*t(σt) はエージェント1のマージナルタイプ分布 Δ(→Θ1t) において凹型であり、エージェント2の Δ(→Θ2t) において凸型である。これにより、効率的な最適化が可能になる。
  • zs-POSGの最終段階(t = h−1)は、零和ベイジアンゲームの族と等価であり、その価値関数はそれぞれのエージェントのマージナルにおける凹型/凸型構造を継承する。
  • 価値関数の構造により、各々が相手の戦略に対して最適反応戦略をとる線形セグメントへの分解が可能になる。
  • σt が連続的であるにもかかわらず、凹型/凸型構造がスケーラブルなアルゴリズムの基盤を提供する。ただし、直接的な後退帰納法は依然として困難である。
  • 本手法は、協調的Dec-POMDPsにおける十分統計量の概念を零和設定へ一般化し、不完全情報下での合理的な意思決定にその有効性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。