Skip to main content
QUICK REVIEW

[論文レビュー] BL-WoLF: A Framework For Loss-Bounded Learnability In Zero-Sum Games

Vincent Conitzer, Tüomas Sandholm|arXiv (Cornell University)|Jul 3, 2003
Advanced Bandit Algorithms Research参考文献 22被引用数 12
ひとこと要約

本稿では、学習中の損失が有界である反復ゼロサムゲームにおける学習コストを分析するためのフレームワーク、BL-WoLFを導入する。敵対的条件下での学習可能性を形式化し、完全なゲーム知識がなくても、確率的および近似的な学習戦略を通じて、決定論的および確率的ゲーム族の両方において、損失が有界に保たれることを示す。

ABSTRACT

We present BL-WoLF, a framework for learnability in repeated zero-sum games where the cost of learning is measured by the losses the learning agent accrues (rather than the number of rounds). The game is adversarially chosen from some family that the learner knows. The opponent knows the game and the learner's learning strategy. The learner tries to either not accrue losses, or to quickly learn about the game so as to avoid future losses (this is consistent with the Win or Learn Fast (WoLF) principle; BL stands for ``bounded loss''). Our framework allows for both probabilistic and approximate learning. The resultant notion of {\em BL-WoLF}-learnability can be applied to any class of games, and allows us to measure the inherent disadvantage to a player that does not know which game in the class it is in. We present {\em guaranteed BL-WoLF-learnability} results for families of games with deterministic payoffs and families of games with stochastic payoffs. We demonstrate that these families are {\em guaranteed approximately BL-WoLF-learnable} with lower cost. We then demonstrate families of games (both stochastic and deterministic) that are not guaranteed BL-WoLF-learnable. We show that those families, nevertheless, are {\em BL-WoLF-learnable}. To prove these results, we use a key lemma which we derive.

研究の動機と目的

  • 反復ゼロサムゲームにおける学習コストを測るフレームワークを形式化すること。ここで、コストは時間ではなく累積損失として定義される。
  • 学習エージェントの知識不足を悪用する敵対的相手、特に学習者の戦略を把握している相手の挑戦に対処すること。
  • エージェントが高コストを回避するか、近似的に最適戦略に素早く到達することを保証する学習可能性の概念を構築すること。これはWin-or-Learn-Fast(WoLF)原則と整合的である。
  • 保証されたとらえ方と近似的なBL-WoLF学習可能性の違いを明確にし、どのゲーム族が有界損失のもとで学習可能であるかを同定すること。
  • 決定論的および確率的ゲーム族に対して理論的保証を提供すること。完全な学習可能性が保証されない場合でも、有界損失が達成可能である場合を含む。

提案手法

  • 敵対的条件下での反復ゼロサムゲームにおける学習可能性を評価するためのフレームワークとして、BL-WoLF(Bounded Loss-Win or Learn Fast)を提案する。
  • 保証されたBL-WoLF学習可能性、保証された近似的なBL-WoLF学習可能性、BL-WoLF学習可能性、および近似的なBL-WoLF学習可能性の4つの定義を導入し、それぞれ異なる損失バウンドを設ける。
  • あるゲーム族が保証された近似的にBL-WoLF学習可能であるならば、期待値においても近似的にBL-WoLF学習可能であることを示すための重要な補題を用いる。
  • 決定的報酬を持つゲーム族(例:get-close-to-the-target、一般化されたジャンケンパーとダミーを含む)および確率的報酬を持つゲーム族(例:ランダム方向一般化ジャンケンパーとダミーを含む)にこのフレームワークを適用する。
  • 完全にBL-WoLF学習可能とは保証されないが、期待損失制約のもとではBL-WoLF学習可能なゲーム族(例:get-close-to-one-of-two-targets、一般化されたマッチングペニーとダミーを含む)が存在することを示す。
  • エージェントが探索と活用のバランスを保ちつつ累積損失を最小化できるように、確率的および近似的な学習戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1既知のゲーム族から選ばれた敵対的ゲームにおいて、学習エージェントが反復ゼロサムゲームで有界損失を達成できるか?
  • RQ2敵対的状況下で、学習コスト(累積損失として測定)は従来の時間ベースの学習指標と比べてどのように異なるか?
  • RQ3どのゼロサムゲーム族が保証されたBL-WoLF学習可能であり、どのゲーム族が期待損失バウンドのみを必要とするか?
  • RQ4近似的な学習戦略は、依然として近似的に最適なパフォーマンスを達成しつつ、損失コストを低減できるか?
  • RQ5ゲーム族のどの構造的性質が、有界損失のもとでのBL-WoLF学習可能性を決定づけるか?

主な発見

  • 決定的報酬を持つゲーム族(例:get-close-to-the-target、一般化されたジャンケンパーとダミーを含む)は、低い損失コストで保証された近似的にBL-WoLF学習可能である。
  • 確率的ゲーム族(例:ランダム方向一般化ジャンケンパーとダミーを含む)も、保証された近似的にBL-WoLF学習可能である。
  • get-close-to-one-of-two-targets や一般化されたマッチングペニーとダミーを含むゲーム族は、保証されたBL-WoLF学習可能とは言えないが、期待値においてはBL-WoLF学習可能である。
  • 本稿では、保証された近似的なBL-WoLF学習可能性が近似的なBL-WoLF学習可能性を示すことを証明し、学習可能性の概念の階層を確立した。
  • 理論的分析を支援するための重要な補題を導出し、異なる学習可能性定義の比較を可能にするとともに、フレームワークの頑健性を証明した。
  • 本フレームワークは、ゼロサムゲームにおける知識欠如に起因する最悪ケースのコストを測る一般化された手法を提供し、異なるゲーム族間での学習可能性の比較を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。