Skip to main content
QUICK REVIEW

[論文レビュー] The Online Saddle Point Problem and Online Convex Optimization with Knapsacks

Adrian Rivera, He Wang|arXiv (Cornell University)|Jun 21, 2018
Advanced Bandit Algorithms Research参考文献 58被引用数 10
ひとこと要約

本稿は、2人のプレイヤーが零和の凸・凹ゲームに参加するオンラインサドルポイント(OSP)問題を導入し、オンライン凸最適化(OCO)の一般化を提示する。SP-FTLアルゴリズムを提案し、一般ケースでは$\tilde{O}(\sqrt{T})$のSPレジーットを達成し、強い凸・凹ケースでは$O(\log T)$を達成する。また、ナップサックを伴うオンライン凸最適化(OCOwK)への応用において、プライマル・デュアル手法により$O(\sqrt{T})$のレジーットが得られる。

ABSTRACT

We study the online saddle point problem, an online learning problem where at each iteration a pair of actions need to be chosen without knowledge of the current and future (convex-concave) payoff functions. The objective is to minimize the gap between the cumulative payoffs and the saddle point value of the aggregate payoff function, which we measure using a metric called "SP-Regret". The problem generalizes the online convex optimization framework but here we must ensure both players incur cumulative payoffs close to that of the Nash equilibrium of the sum of the games. We propose an algorithm that achieves SP-Regret proportional to $\sqrt{\ln(T)T}$ in the general case, and $\log(T)$ SP-Regret for the strongly convex-concave case. We also consider the special case where the payoff functions are bilinear and the decision sets are the probability simplex. In this setting we are able to design algorithms that reduce the bounds on SP-Regret from a linear dependence in the dimension of the problem to a extit{logarithmic} one. We also study the problem under bandit feedback and provide an algorithm that achieves sublinear SP-Regret. We then consider an online convex optimization with knapsacks problem motivated by a wide variety of applications such as: dynamic pricing, auctions, and crowdsourcing. We relate this problem to the online saddle point problem and establish $O(\sqrt{T})$ regret using a primal-dual algorithm.

研究の動機と目的

  • 2人のプレイヤーが、報酬関数の事前知識なしに、逐次的な凸・凹ゲームにおいて共同で行動を選択するオンラインサドルポイント(OSP)問題を形式化・分析すること。
  • SPレジーットを定義し、累積報酬と集約ゲームのサドルポイント価値との差を最小化すること。
  • 既存のOCOアルゴリズムがOSP設定において有する根本的な限界を確立し、部分線形な個別レジーットが部分線形なSPレジーットを保証しないことを示すこと。
  • ラグランジュ双対性とプライマル・デュアル手法を用いて、OSPフレームワークをナップサックを伴うオンライン凸最適化(OCOwK)問題へ拡張すること。
  • 完全情報とバンディットフィードバックの両方の設定下で、SP-FTLとOGDAを設計・評価し、部分線形なSPレジーット性能を示すこと。

提案手法

  • SP-FTLアルゴリズムは、報酬関数の全履歴に基づき、両プレイヤーの連携行動空間におけるフォローザリーダー戦略を用いて行動を選択する。
  • 単体の意思決定集合を伴う双線形ケースでは、ラグランジュ双対における構造を活用し、次元に対する対数的依存性を実現する。
  • OCOwK問題にプライマル・デュアルアルゴリズムを適用し、ナップサック制約をオンライン勾配上昇による双対変数更新に変換する。
  • バンディットフィードバックは、確率的摂動を用いた勾配推定により処理され、関数の完全な知識なしに部分線形なSPレジーットを達成可能となる。
  • 理論的分析では、レジーット分解と強い凸性の仮定を用いて、SPレジーットの境界を導出する。具体的には、$\tilde{O}(\sqrt{T})$および$O(\log T)$の境界が得られる。
  • 数値的検証では、25回の実験でSP-FTLとOGDAをOCOwKインスタンスに対して比較し、総報酬と最適ベンチマークとの比として性能を測定する。

実験結果

リサーチクエスチョン

  • RQ1既存のOCOアルゴリズムは、部分線形な個別レジーットを達成しているが、OSP問題において部分線形なSPレジーットを達成できるか?
  • RQ2一般の凸・凹OSP設定において、最適なSPレジーット境界は何か?また、問題構造にどのように依存するか?
  • RQ3OSPフレームワークは、OCOwK問題にどのように応用可能か?また、プライマル・デュアル手法により達成可能なレジーット境界は何か?
  • RQ4単体制約付き双線形報酬関数において、次元に線形的依存から対数的依存にまでSPレジーットを低減できるか?
  • RQ5バンディットフィードバック設定下で、OSP設定においてどのような性能保証が達成可能か?

主な発見

  • SP-FTLアルゴリズムは、一般の凸・凹OSP問題において$\tilde{O}(\sqrt{T})$のSPレジーットを達成し、従来のOCOベースの手法を改善する。
  • 強い凸・凹ケースでは、SP-FTLは$O(\log T)$のSPレジーットを達成し、収束速度が速いことを示す。
  • 任意の$o(T)$の個別レジーットを達成するOCOアルゴリズムでも、最悪ケースでは$\tilde{O}(T)$のSPレジーットを被る可能性があり、OCOがOSP設定において有する根本的な限界を示す。
  • 単体の意思決定集合を伴う双線形報酬関数では、SPレジーットが次元に対して対数的に増加する。一般ケースの線形依存性と比較して、顕著な改善が得られる。
  • バンディットフィードバック下でも、提案手法は部分線形なSPレジーットを達成でき、完全情報設定を超えたフレームワークの拡張を実現する。
  • OCOwKへの応用では、プライマル・デュアル手法により$O(\sqrt{T})$のレジーットが達成され、数値結果はOGDAが初期性能に劣るものの収束速度においてSP-FTLを上回ることを確認する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。