Skip to main content
QUICK REVIEW

[論文レビュー] The Kullback-Liebler Divergence as a Lyapunov Function for Incentive Based Game Dynamics

Dashiell Fryer|arXiv (Cornell University)|Jun 30, 2012
Evolutionary Game Theory and Cooperation参考文献 10被引用数 5
ひとこと要約

この論文は、Kullback-Leibler (KL) 散発を、進化的安定状態における反復的動的システムに既知の結果として適用するのではなく、インcentiveに基づくゲーム動的システムの広いクラスへ一般化し、条件を満たす場合に均衡点での漸近的安定性を保証することを証明する。主な貢献は、反復的動的システムおよび進化的安定状態に関する先行結果を特別な場合として含む一般定理の確立である。

ABSTRACT

It has been shown that the Kullback-Leibler divergence is a Lyapunov function for the replicator equations at evolutionary stable states, or ESS. In this paper we extend the result to a more general class of game dy-namics. As a result, sufficient conditions can be given for the asymptotic stability of rest points for the entire class of incentive dynamics. The previous known results will be can be shown as corollaries to the main theorem. 1 Information Theory and The Replicator Dy-namics Information theory was originally developed by Claude Shannon and Warren Weaver [Sha01, SW49] as a mathematical framework to describe problems in communication including, but not limited to, data compression and storage. They introduced measures of information called entropy1. Shannon’s entropy, denoted H(P), is a measure of the average uncertainty in a random variable, P. It can be interpreted as the average number of bits needed to encode a message drawn i.i.d. from P. Maximizing the entropy can be used to give a lower bound on this average number of bits needed for encryption. For our purposes, the concepts of cross entropy and relative entropy will be of great use. The Kullback-Leibler divergence (KL divergence or DKL) [KL51], or relative entropy is a measure of information gain (loss) from one state to another. More precisely, it is an average measure of the additional bits needed 1In fact, the Shannon entropy is simply the Boltzmann entropy [Jay65] without the con-stants 1 ar

研究の動機と目的

  • 進化的安定状態における反復的動的システムに対してKL発散がリャプノフ関数であるという既知の結果を一般化すること。
  • インセンティブに基づくゲーム動的システムの広いクラスにおいてKL発散がリャプノフ関数として機能する十分条件を同定すること。
  • 反復的動的システムおよびESS安定性に関する先行結果を、統一的理論枠組みに統合し、包含すること。
  • 情報理論的ツールを用いて進化的ゲーム動的システムにおける漸近的安定性を分析する理論的基盤を提供すること。

提案手法

  • インセンティブ関数によって駆動される戦略の更新を特徴とする、連続時間動的システムのクラスとしてインセンティブ動的システムを形式化する。
  • 現在の戦略分布と均衡点との間のKullback-Leibler発散を、候補となるリャプノフ関数として定義する。
  • インセンティブ関数に関する特定の条件下で、軌道に沿ったKL発散の時間微分が負半定値であることを証明する。
  • 均衡点が内部解であり、かつインセンティブ関数が特定の正則性および正の性質を満たす場合、KL発散が軌道に沿って単調に減少することを確立する。
  • リャプノフ安定性定理を用いて、KL発散の微分が負定値である場合に、均衡点の漸近的安定性が保証されることを結論づける。
  • 特定のインセンティブ関数(例:ロジットや最良応答インセンティブ)を選択することで、反復的動的システムに関する既知の結果を再導出する。

実験結果

リサーチクエスチョン

  • RQ1インセンティブに基づくゲーム動的システムにおいて、Kullback-Leibler発散がリャプノフ関数であるための条件は何か?
  • RQ2情報理論的ツールを用いて、進化的安定状態の安定性分析を反復的動的システムを超えて一般化できるか?
  • RQ3インセンティブ関数の性質が、動的システムの収束挙動にどのように影響するか?
  • RQ4一般インセンティブ動的システムにおける、KL発散と均衡点の安定性の関係は何か?
  • RQ5反復的動的システムに関する先行結果が、より一般の定理の推論として得られるか?

主な発見

  • インセンティブ関数にやや弱い正則性および正の性質が課せられる場合、KL発散は広いクラスのインセンティブに基づくゲーム動的システムにおいてリャプノフ関数として機能する。
  • 均衡点がナッシュ均衡であり、かつインセンティブ関数が適切な滑らかさおよび厳密な正の性質を満たす場合、軌道に沿ったKL発散の時間微分は負半定値である。
  • KL発散の微分が負定値である限り、均衡点の漸近的安定性が保証される。これは、インセンティブ関数にさらに強い条件が課せられる場合に成立する。
  • インセンティブ関数がロジットまたは最良応答写像に対応する場合、反復的動的システムおよび進化的安定状態が特別な場合として回復される。
  • 一般定理は、進化的ゲーム理論における先行結果を統合・拡張する統一的枠組みを提供する。
  • 相対エントロピーをリャプノフ関数として用いることで、情報理論的原則を用いた収束ダイナミクスのより深い理解が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。