[論文レビュー] New Projection-free Algorithms for Online Convex Optimization with Adaptive Regret Guarantees
本稿では、新しい不実行可能射影技術を用いたオンライン勾配降下に基づく、投影フリーなオンライン凸最適化アルゴリズムを提案する。全情報設定では$O(T^{3/4})$の適応的リグレットを達成し、バンディット設定では$O(T^{3/4})$の適応的期待リグレットを達成する。これは、線形最適化オракル(LOO)をたった$O(T)$回呼び出すことで実現される。この手法は直交射影を避ける代わりに、効率的なオーケストラに依存し、分離オーケストラを用いる場合、全情報設定で$O(ackslashsqrt{T})$の適応的リグレットを達成する。
We present new efficient extit{projection-free} algorithms for online convex optimization (OCO), where by projection-free we refer to algorithms that avoid computing orthogonal projections onto the feasible set, and instead relay on different and potentially much more efficient oracles. While most state-of-the-art projection-free algorithms are based on the extit{follow-the-leader} framework, our algorithms are fundamentally different and are based on the extit{online gradient descent} algorithm with a novel and efficient approach to computing so-called extit{infeasible projections}. As a consequence, we obtain the first projection-free algorithms which naturally yield extit{adaptive regret} guarantees, i.e., regret bounds that hold w.r.t. any sub-interval of the sequence. Concretely, when assuming the availability of a linear optimization oracle (LOO) for the feasible set, on a sequence of length $T$, our algorithms guarantee $O(T^{3/4})$ adaptive regret and $O(T^{3/4})$ adaptive expected regret, for the full-information and bandit settings, respectively, using only $O(T)$ calls to the LOO. These bounds match the current state-of-the-art regret bounds for LOO-based projection-free OCO, which are extit{not adaptive}. We also consider a new natural setting in which the feasible set is accessible through a separation oracle. We present algorithms which, using overall $O(T)$ calls to the separation oracle, guarantee $O(\sqrt{T})$ adaptive regret and $O(T^{3/4})$ adaptive expected regret for the full-information and bandit settings, respectively.
研究の動機と目的
- 計算コストの高い直交射影を避ける、投影フリーなオンライン凸最適化アルゴリズムの開発。
- 任意の部分列に対して成り立つリグレットバウンド(適応的リグレット保証)を達成するが、Follow-The-Leaderフレームワークに依存しないこと。
- ステートオブザアートのリグレットバウンドを維持しながら、線形最適化オーケストラ(LOO)または分離オーケストラへの呼び出しを$O(T)$回以内に抑えるアルゴリズムの設計。
- 可能な場合、実行可能集合が分離オーケストラを介してアクセスされる設定にフレームワークを拡張し、全情報設定でより優れた適応的リグレットを達成すること。
- 強い凸損失に対する収束証明に欠陥があった2022年COLT版を是正し、リグレットバウンドの対数因子の劣化を伴っても改善すること。
提案手法
- 本アルゴリズムは、実行可能集合への直交射影を必要としない、新たな不実行可能射影メカニズムを備えたオンライン勾配降下に基づく。
- 実行可能集合への効率的アクセスを可能にする線形最適化オーケストラ(LOO)を用い、明示的な射影なしで降下ステップを計算可能にする。
- バンディット設定では、勾配推定のための確率的スムージング技術を採用し、LOOを確率的設定で利用可能にする。
- 分離オーケストラに基づくバージョンでは、繰り返し距離低減戦略を用いた圧縮手順により、反復値を実行可能集合に近づける。
- リグレットとオーケストラ呼び出しの効率のバランスを取るために、ステップサイズとスムージングパラメータを動的に調整する。
- 理論的分析では、不実行可能射影プロセスにおける距離の減少と、勾配推定誤差のバウンドを活用し、適応的リグレット保証を導出する。
実験結果
リサーチクエスチョン
- RQ1投影フリーなオンライン凸最適化アルゴリズムは、Follow-The-Leaderフレームワークに依存せず、任意の部分列に対して適応的リグレット保証(リグレットバウンド)を達成できるか?
- RQ2線形最適化オーケストラ(LOO)への呼び出しを$O(T)$回以内に抑えながら、最良の既知の非適応的リグレットバウンドに一致するようなアルゴリズムを設計可能か?
- RQ3実行可能集合がLOOではなく分離オーケストラを介してアクセスされる設定に、このフレームワークをどのように拡張できるか?
- RQ4直交射影ではなく不実行可能射影を用いる場合、リグレット性能とオーケストラ呼び出し回数のトレードオフはどのようなものか?
- RQ5LOOまたは分離オーケストラへの呼び出しを$O(T)$回以内に抑えながら、バンディット設定でも適応的リグレット保証を維持できるか?
主な発見
- 提案アルゴリズムは、全情報設定で$O(T^{3/4})$の適応的リグレット、バンディット設定で$O(T^{3/4})$の適応的期待リグレットを達成し、線形最適化オーケストラ(LOO)への呼び出しを$O(T)$回に抑える。
- 分離オーケストラ設定では、全情報設定で$O(\sqrt{T})$の適応的リグレット、バンディット設定で$O(T^{3/4})$の適応的期待リグレットを達成し、依然として$O(T)$回の合計呼び出しを維持する。
- 本手法は、直交射影を避ける新たな不実行可能射影技術を導入し、LOOまたは分離オーケストラを用いた効率的実装を可能にする。
- 本アルゴリズムは、Follow-The-Leaderに基づくアプローチに内在する制限を克服し、自然に適応的リグレット保証を達成する最初の投影フリーOCO手法である。
- 元のCOLT 2022版における強い凸損失に対する収束証明の欠陥を是正したが、新たなリグレットバウンドは対数因子の劣化を伴う。
- 理論的分析により、分離オーケストラ呼び出し回数が$O(T)$のまま維持され、不実行可能反復値にもかかわらず距離の減少メカニズムが収束を保証することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。