Skip to main content
QUICK REVIEW

[論文レビュー] Online non-convex optimization with imperfect feedback

Amélie Héliou, Matthieu Martin|arXiv (Cornell University)|Oct 16, 2020
Advanced Bandit Algorithms Research参考文献 47被引用数 5
ひとこと要約

本稿は、損失関数の正確なモデルや実現損失が観測可能でない不完全なフィードバック下におけるオンライン非凸最適化に対して、二重平均に基づく混合戦略学習方針を提案する。学習者が損失関数の不正確なモデルまたは実現損失しか観測できない状況においても、$Ó(T^{1/2})$ の静的レジーダルと $Ó(T^{2/3}V_T^{1/3})$ の動的レジーダルの上限を確立する。特に、カーネルベースの損失推定を用いることで、バンドイットフィードバック下でも、関数モデルを明示的に必要としないHedgeに類似したアルゴリズムへの拡張という未解決の問題を解決する。

ABSTRACT

We consider the problem of online learning with non-convex losses. In terms of feedback, we assume that the learner observes - or otherwise constructs - an inexact model for the loss function encountered at each stage, and we propose a mixed-strategy learning policy based on dual averaging. In this general context, we derive a series of tight regret minimization guarantees, both for the learner's static (external) regret, as well as the regret incurred against the best dynamic policy in hindsight. Subsequently, we apply this general template to the case where the learner only has access to the actual loss incurred at each stage of the process. This is achieved by means of a kernel-based estimator which generates an inexact model for each round's loss function using only the learner's realized losses as input.

研究の動機と目的

  • 不完全なフィードバック下におけるオンライン非凸最適化のギャップを埋めること、特に先行研究が正確な損失モデルを仮定している点に起因する。
  • Hedge や FTPL のような確率的アルゴリズムを、損失関数全体ではなく、実現損失のみが観測可能な状況に一般化すること。
  • 非凸設定下で、不正確なフィードバックまたはバンドイットフィードバック下において、静的および動的両方のレジーダル上限をタイトに導出すること。
  • Hedge型アルゴリズムが、損失関数の明示的モデルが存在しないバンドイット設定下でも、非線形レジーダルを達成できるかどうかという未解決の問題を解決すること。

提案手法

  • 不正確な損失モデルに基づく二重平均に依存する一般化されたアルゴリズムテンプレートを提案し、非凸オンライン学習におけるレジーダル最小化を可能にする。
  • 各ラウンドにおける学習者の実現損失のみを用いて、損失関数の不正確なモデルを構築するカーネルベースの推定器を導入する。
  • 履歴の実現損失から損失モデルを構築することで、二重平均フレームワークをバンドイットフィードバックに適用し、明示的な関数カバレッジを回避する。
  • ウィンドウ戦略、正則化パラメータ、損失モデル誤差率の間の相互作用を分析することで、レジーダル上限を導出する。
  • 適応的パラメータを用いたタイムウィンドウ分析を採用し、探索と活用のバランスを保ちながら、累積レジーダルを最小化する。
  • 指数的重みと二重平均を組み合わせた混合戦略ポリシーを採用し、最適なレジーダルスケーリングを達成する。

実験結果

リサーチクエスチョン

  • RQ1確率的オンライン学習アルゴリズムは、不正確または部分的なフィードバックしか得られない非凸設定下でも、非線形レジーダルを達成できるか?
  • RQ2Hedge型アルゴリズムは、損失関数の明示的モデルが存在しない状況でも、バンドイットフィードバックに拡張可能か?
  • RQ3損失関数が非凸であり、損失関数の完全なモデルが得られない状況下で、不完全なフィードバック下にどのようなレジーダル上限が達成可能か?
  • RQ4非凸オンライン最適化において、カーネルベースの損失推定は、グリッドベースの有限アームバンディット手法と比較してどの程度優れているか?
  • RQ5不完全なフィードバック下におけるオンライン非凸最適化において、探索、正則化、モデル誤差の最適なトレードオフは何か?

主な発見

  • 提案された二重平均フレームワークは、不正確な損失モデル下で $Ó(T^{1/2})$ の静的レジーダルを達成し、凸設定下での最適レートと一致する。
  • 動的レジーダルに関しては、損失モデル誤差に関する一般的な仮定の下で $Ó(T^{2/3}V_T^{1/3})$ を達成する。ここで $V_T$ は最適ポリシーの変動を測る。
  • 実現損失のみが観測可能な状況では、カーネルベースの推定器により、正確なモデルがある場合と同等の $Ó(T^{1/2})$ の静的レジーダルと $Ó(T^{2/3}V_T^{1/3})$ の動的レジーダル上限が達成可能である。
  • 数値実験では、カーネルベース手法が理論的 $T^{-1/3}$ レジーダル勾配に収束するのに対し、グリッドベース手法は有限のレジーダルに収束することが示され、収束が遅いことが判明した。
  • カーネル手法はグリッドベースの EXP3 アプローチと比較して著しく低い分散とより速いレジーダルの減少を示し、実用的効率性を裏付けた。
  • 適応的ウィンドウ化とパrameterチューニングにより、理論的レジーダル上限 $\mathbb{E}[\operatorname{DynReg}(T)] = \mathcal{O}(T^{1+n\mu+\beta-\rho} + T^{1-\beta} + T^{1-\mu} + T^{2\rho-n\mu-\beta}V_T)$ が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。