Skip to main content
QUICK REVIEW

[論文レビュー] Online Continuous DR-Submodular Maximization with Long-Term Budget Constraints

Omid Sadeghi, Maryam Fazel|arXiv (Cornell University)|Jun 30, 2019
Advanced Bandit Algorithms Research参考文献 23被引用数 4
ひとこと要約

本稿では、長期間にわたる予算制約下でのオンライン連続的DR-サブモジュラー最大化問題に対して、オンラインサドルポイントハイブリッド勾配(OSPHG)アルゴリズムを提案する。目的関数は単調なDR-サブモジュラーであり、予算関数は線形である。ベンチマークウィンドウサイズ $W = o(T)$ の場合、サブリニアなレジーットと予算違反の境界を確立する。これは、$W = T$ の場合にサブリニアなレジーットが達成不可能であるという事実を克服する。主な貢献は、$W = o(T)$ の場合に、$(1 - \frac{1}{e})$-近似のレジーット境界とサブリニアな総予算違反を達成することである。

ABSTRACT

In this paper, we study a class of online optimization problems with long-term budget constraints where the objective functions are not necessarily concave (nor convex) but they instead satisfy the Diminishing Returns (DR) property. Specifically, a sequence of monotone DR-submodular objective functions $\{f_t(x)\}_{t=1}^T$ and monotone linear budget functions $\{\langle p_t,x angle \}_{t=1}^T$ arrive over time and assuming a total targeted budget $B_T$, the goal is to choose points $x_t$ at each time $t\in\{1,\dots,T\}$, without knowing $f_t$ and $p_t$ on that step, to achieve sub-linear regret bound while the total budget violation $\sum_{t=1}^T \langle p_t,x_t angle -B_T$ is sub-linear as well. Prior work has shown that achieving sub-linear regret is impossible if the budget functions are chosen adversarially. Therefore, we modify the notion of regret by comparing the agent against a $(1-\frac{1}{e})$-approximation to the best fixed decision in hindsight which satisfies the budget constraint proportionally over any window of length $W$. We propose the Online Saddle Point Hybrid Gradient (OSPHG) algorithm to solve this class of online problems. For $W=T$, we recover the aforementioned impossibility result. However, when $W=o(T)$, we show that it is possible to obtain sub-linear bounds for both the $(1-\frac{1}{e})$-regret and the total budget violation.

研究の動機と目的

  • アドバーシャルな条件下で単調なDR-サブモジュラー目的関数と線形予算制約を有するオンライン最適化問題に対処すること。
  • 全期間にわたって予算関数がアドバーシャルな場合($W = T$)、サブリニアなレジーットが達成不可能であるという事実を克服すること。
  • スライディングウィンドウサイズ $W$ の固定意思決定に対する $(1 - \frac{1}{e})$-近似を基準として、サブリニアなレジーットとサブリニアな予算違反を達成するアルゴリズムを設計すること。
  • 時間的に変化するアドバーシャルな予算関数のもとで、実行可能かつ有効な性能保証を可能にする新たなレジーットの定式化を提示すること。

提案手法

  • DR-サブモジュラー関数に対するオンラインサドルポイント法とハイブリッド勾配更新を組み合わせた、オンラインサドルポイントハイブリッド勾配(OSPHG)アルゴリズムを提案する。
  • スライディングウィンドウサイズ $W$ を用い、任意の長さ $W$ のウィンドウ内で予算制約を割合的に満たす固定意思決定を基準として、エージェントのパフォーマンスを比較する。
  • 双対変数 $\lambda_t$ を用いたラグランジュ緩和フレームワークを採用し、予算制約を処理する。双対更新はラグランジュ関数の勾配上昇に基づく。
  • プライマルと双対の更新を交互に実行するハイブリッド勾配スキームを導入し、レジーットと制約残差の境界を用いて収束を分析する。
  • 強凸性と滑らかさの性質を用いて項をバウンディングすることで、テレスコピング和のアプローチを用いて、レジーットと予算違反の境界を導出する。
  • ラグランジュ関数の新しい分解とテレスコピング和の技法を用い、$(1 - \frac{1}{e})$-レジーットと予算違反を分離する。これにより、$W = o(T)$ の下でサブリニアな境界を達成可能となる。

実験結果

リサーチクエスチョン

  • RQ1全期間にわたって予算関数がアドバーシャルな場合($W = T$)、オンライン連続的DR-サブモジュラー最大化でサブリニアなレジーットを達成できるか。
  • RQ2アドバーシャルな予算関数のもとで、サブリニアな総予算違反を維持しながらサブリニアなレジーットを達成することは可能か。
  • RQ3スライディングウィンドウサイズ $W$ の固定意思決定が、ウィンドウ内に割合的に予算制約を満たす場合、どのような性能保証が達成可能か。
  • RQ4ウィンドウサイズ $W$ の選択が、オンラインDR-サブモジュラー最適化におけるレジーットと予算違反のトレードオフにどのように影響するか。
  • RQ5$W = o(T)$ の場合に、$(1 - \frac{1}{e})$-近似のレジーット境界をサブリニアな総予算違反とともに達成することは可能か。

主な発見

  • ウィンドウサイズ $W = o(T)$ の場合、サブリニアなレジーットとサブリニアな総予算違反が達成可能であり、$W = T$ の場合の不可能性を克服する。
  • 提案されたOSPHGアルゴリズムは、$W = o(T)$ の下で、$(1 - \frac{1}{e})$-レジーット境界とサブリニアな総予算違反を達成し、オンラインDR-サブモジュラー最適化における新たな性能保証を確立する。
  • レジーットと制約残差の境界は、ラグランジュ関数の新しい分解とテレスコピング和の技法を用いて導出され、$W$、$T$、滑らかさパラメータに明示的な依存関係を持つ。
  • 解析により、$WT \geq 16R^2$ の場合、最終の境界から $\sum_{t=1}^{T} \lambda_t^2$ 項を除去でき、最終のレジーット式が簡略化される。
  • 主な技術的洞察は、ウィンドウベースのベンチマークが境界効果を相殺できることであり、これにより、アドバーシャルな予算関数のもとでもサブリニアなパフォーマンスが達成可能となる。
  • $W = o(T)$ の場合、適切なパrameterチューニングのもとで、アルゴリズムは $\mathcal{O}(W)$ のレジーットと $\mathcal{O}(WT)$ の予算違反を達成し、両者とも $T$ に対してサブリニアとなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。