Skip to main content
QUICK REVIEW

[論文レビュー] Response-Based Approachability and its Application to Generalized No-Regret Algorithms

Andrey Bernstein, Nahum Shimkin|arXiv (Cornell University)|Dec 30, 2013
Advanced Bandit Algorithms Research参考文献 25被引用数 5
ひとこと要約

本稿では、投影に基づく計算を応答に基づく戦略に置き換える新規の到達可能性アルゴリズムを提案する。幾何的分離条件の代わりにブラックウェルの双対条件を用いる。この手法により、制約付きレジーム最小化やグローバルコスト関数最適化といった、投影が計算的に高価だが応答は容易に得られる一般化されたノーレジーム問題において、計算的に効率的なアルゴリズムが可能となり、これらの設定における初めての計算効率の良いアルゴリズムが実現される。

ABSTRACT

Approachability theory, introduced by Blackwell (1956), provides fundamental results on repeated games with vector-valued payoffs, and has been usefully applied since in the theory of learning in games and to learning algorithms in the online adversarial setup. Given a repeated game with vector payoffs, a target set $S$ is approachable by a certain player (the agent) if he can ensure that the average payoff vector converges to that set no matter what his adversary opponent does. Blackwell provided two equivalent sets of conditions for a convex set to be approachable. The first (primary) condition is a geometric separation condition, while the second (dual) condition requires that the set be {\em non-excludable}, namely that for every mixed action of the opponent there exists a mixed action of the agent (a {\em response}) such that the resulting payoff vector belongs to $S$. Existing approachability algorithms rely on the primal condition and essentially require to compute at each stage a projection direction from a given point to $S$. In this paper, we introduce an approachability algorithm that relies on Blackwell's {\em dual} condition. Thus, rather than projection, the algorithm relies on computation of the response to a certain action of the opponent at each stage. The utility of the proposed algorithm is demonstrated by applying it to certain generalizations of the classical regret minimization problem, which include regret minimization with side constraints and regret minimization for global cost functions. In these problems, computation of the required projections is generally complex but a response is readily obtainable.

研究の動機と目的

  • 計算コストの高い投影ステップを避けるために、幾何的投影の代わりに応答マップに依存する新しい到達可能性アルゴリズムの開発。
  • 標準的な投影ベースの手法が不適切となるような、付加的制約付きのレジーム最小化やグローバルコスト関数といった一般化されたノーレジーム問題の取り扱い。
  • これらの一般化された設定において、応答計算が計算的に容易である一方で、投影計算が依然として複雑であることを示すこと。
  • 校正予測やターゲット集合への直接投影に依存する従来のアルゴリズムに対する計算的に効率的な代替手法の提供。
  • 連続的行動空間および確率的ゲームモデルへの到達可能性理論の適用範囲を、応答ベースの計算によって拡張すること。

提案手法

  • アルゴリズムはブラックウェルの双対到達可能性条件に基づく。これは、相手の混合戦略に対して、期待ペイオフベクトルがターゲット集合に属するような対応するエージェント行動が存在することを要件とする。
  • 各段階で、現在の平均ペイオフベクトルをターゲット集合に投影する代わりに、相手の現在の混合戦略に対する応答を計算する。
  • ステアリング方向は投影からではなく、応答から導出され、ブラックウェルの元来の到達可能性アルゴリズムの修正版が用いられる。
  • 平均ペイオフがすでにターゲット条件を満たしている場合に、ステアリング方向の成分をゼロにすることで、有界でないターゲット集合に対応する。
  • 凸制約集合の場合、応答計算は凸計画問題に帰着され、多面体制約の場合には線形計画問題に帰着される。
  • 報酬対コストの最大化や制約付き報酬最大化といった複数の目的を持つ問題に対応するため、ステアリング方向を実行可能性制約を満たすように修正する。

実験結果

リサーチクエスチョン

  • RQ1ターゲット集合への投影計算を避けて、応答マップに依存することで到達可能性を達成できるか?
  • RQ2複雑な制約を伴う一般化されたノーレジーム問題において、応答計算は投影計算よりも効率的か?
  • RQ3到達可能性の双対条件を効果的に活用して、計算的に効率的な学習アルゴリズムを設計できるか?
  • RQ4標準の投影ベースのアルゴリズムと同等の条件下で、応答ベースのアプローチはターゲット集合への確実な収束を維持できるか?
  • RQ5この手法は、双線形報酬関数を持つ連続的行動空間および確率的ゲームモデルに拡張可能か?

主な発見

  • 提案された応答ベースのアルゴリズムは、応答マップの存在を仮定し、ブラックウェルの双対条件を満たすことで、幾何的投影を一切必要とせず、凸ターゲット集合への到達可能性を達成する。
  • 制約付きレジーム最小化の問題では、先行研究で必要とされる校正予測の計算を回避し、代わりに相手の混合戦略に対する最適応答を計算する。
  • グローバルコスト関数を伴う問題では、応答計算は凸計画問題に帰着され、効率的に解けるが、満足できる集合の凸包への投影は計算的に高価である。
  • 標準のブラックウェルアルゴリズムと同等の条件下で、ターゲット集合への収束を維持し、平均ペイオフベクトルがターゲット集合に確実に収束することを保証する。
  • 行動空間が凸集合に属する連続的行動モデルに、報酬関数が双線形である場合にも、この手法は収束性と計算効率を保ったまま拡張可能である。
  • 現在の平均がすでにターゲットの閾値を満たしている場合に、ステアリング方向の成分をゼロにすることで、収束性を損なわずに計算効率を向上させることができる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。