Skip to main content
QUICK REVIEW

[論文レビュー] An online convex optimization approach to Blackwell's approachability

Nahum Shimkin|arXiv (Cornell University)|Jan 1, 2016
Advanced Bandit Algorithms Research参考文献 21被引用数 5
ひとこと要約

本稿では、再帰的ベクトル報酬ゲームにおけるブラックウェルの到達可能性のための直接的オンライン凸最適化(OCO)フレームワークを提示する。従来のオンライン線形計画法への依存を排除した。凸標的集合のサポート関数とOCOアルゴリズム(特にフォロー・ザ・リーダー)を活用することで、到達可能性戦略を一般化し、ブラックウェルの元来のアルゴリズムと収束保証を回復するとともに、ノルム依存の柔軟な設計を可能にする。

ABSTRACT

The problem of approachability in repeated games with vector payoffs was introduced by Blackwell in the 1950s, along with geometric conditions and corresponding approachability strategies that rely on computing a sequence of direction vectors in the payoff space. For convex target sets, these vectors are obtained as projections from the current average payoff vector to the set. A recent paper by Abernethy, Batlett and Hazan (2011) proposed a class of approachability algorithms that rely on Online Linear Programming for obtaining alternative sequences of direction vectors. This is first implemented for target sets that are convex cones, and then generalized to any convex set by embedding it in a higher-dimensional convex cone. In this paper we present a more direct formulation that relies on general Online Convex Optimization (OCO) algorithms, along with basic properties of the support function of convex sets. This leads to a general class of approachability algorithms, depending on the choice of the OCO algorithm and the used norms. Blackwell's original algorithm and its convergence are recovered when Follow The Leader (or a regularized version thereof) is used for the OCO algorithm.

研究の動機と目的

  • オンライン凸最適化(OCO)を用いることで、埋め込みやオンライン線形計画法に依存しない、ブラックウェルの到達可能性に対するより直接的で一般化されたアプローチを開発すること。
  • 凸標的集合のサポート関数を用いて、既存の到達可能性アルゴリズムを統一的かつ一般化すること。
  • 異なるOCOアルゴリズムとノルムを選択することで、標的集合への収束を保ちつつ、到達可能性戦略の柔軟な設計を可能にすること。
  • フォローザリーダー(またはその正則化版)をOCOフレームワークで使用した場合、ブラックウェルの元来のアルゴリズムとその収束特性が特別なケースとして回復されること。

提案手法

  • 報酬空間における集合の双対表現を提供する凸標的集合のサポート関数を用いて、到達可能性問題を定式化する。
  • 方向ベクトルの選択問題を、サポート関数上で定義されたオンライン凸最適化問題に還元する。
  • 標準的なOCOアルゴリズム(例:フォローザリーダー)を用いて、標的集合へ向かう戦略を導く方向ベクトルを生成する。
  • 選択されたOCOアルゴリズムのリグレットバウンドとサポート関数の部分勾配性を活用することで収束を保証する。
  • 高次元の凸錐への埋め込みを経由するのではなく、直接的なOCO定式化により、任意の凸集合へとフレームワークを拡張する(主な貢献はこのような埋め込みを不要とした点)。
  • OCOアルゴリズムおよび関連するノルムの選択が、到達可能性戦略の収束速度とロバストネスに与える影響を示す。

実験結果

リサーチクエスチョン

  • RQ1ブラックウェルの到達可能性フレームワークにおいて、埋め込みに基づくアプローチに代えて、直接的なOCO定式化が可能か?
  • RQ2異なるOCOアルゴリズムとノルムは、到達可能性戦略の設計と収束にどのように影響するか?
  • RQ3OCOベースのアプローチが、ブラックウェルの元来のアルゴリズムとその収束保証を回復する条件は何か?
  • RQ4凸集合のサポート関数は、一般化され柔軟な到達可能性フレームワークを可能にする上で果たす役割は何か?
  • RQ5凸錐への事前埋め込みを要件としないで、任意の凸標的集合へとフレームワークを一般化できるか?

主な発見

  • 提案されたOCOベースのフレームワークは、凸集合を高次元の錐に埋め込む必要なく、再帰的ベクトル報酬ゲームにおける到達可能性の一般的で直接的な手法を提供する。
  • フォローザリーダー(またはその正則化版)をOCOアルゴリズムとして使用した場合、得られる戦略はブラックウェルの元来の到達可能性アルゴリズムとその収束特性を回復する。
  • フレームワークは、OCOアルゴリズムのリグレットと、平均報酬ベクトルが標的集合へ収束する速度との間に明確な関係を確立する。
  • OCOアルゴリズムおよび関連するノルムの選択は、方向ベクトルに直接影響を与え、結果として標的集合への到達経路と速度に影響を及ける。
  • 標的集合のサポート関数は、OCO問題の定式化を可能にし、必要に応じて凸性と微分可能性を保証する重要な双対表現である。
  • OCOアルゴリズムを直接用いることで、従来のオンライン線形計画法に基づく手法を、集合の幾何的性質をサポート関数を通じて直接扱うことで一般化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。