Skip to main content
QUICK REVIEW

[論文レビュー] Nonlinear stochastic multiarmed bandit problems with inexact oracle

Alexander Gasnikov, Ekaterina Krymova|arXiv (Cornell University)|Sep 5, 2015
Advanced Bandit Algorithms Research参考文献 14被引用数 3
ひとこと要約

本稿では、ノイズのある関数評価を用いた凸および強凸問題に対するゼロ次順応的オンライン最適化手法を提案する。不正確なオракルを扱えるようにミラー降下法を一般化し、有界なノイズ下でも有効な収束レートを確立した。この手法は、やや厳しい条件下でも最適なレグレットバウンドを達成し、ノイズレベルおよび問題次元の明示的依存関係を示している。

ABSTRACT

In the paper we consider one point and two point multiarmed bamdit problems. In other words we consider the online stochastic convex optimization problems with oracle that return the value (realization) of the function at one point or at two points. We allow these values to be inexact, but the level of noise should be small enough. We generalize well known results for inexact oracle case. And we also generalize classical results to prox-structures differ from euclidian.

研究の動機と目的

  • 勾配ではなく関数評価のみを用いるゼロ次オンライン最適化手法の開発。
  • 有界なノイズ(不正確なオーケストラ)条件下でのその手法の収束レートの分析。
  • 性能が著しく低下するようになるノイズレベルの閾値の特定。
  • 1点および2点フィードバック機構を含む、関数値フィードバックのみで動作するオンライン設定へのミラー降下法の拡張。
  • 既知の下界と一致する理論的保証を確立し、提案手法の最適性を示すこと。

提案手法

  • 勾配推定を関数値の差分(ゼロ次近似)に置き換えた、変更されたミラー降下フレームワークを用いる。
  • 1点フィードバックに比べて勾配推定の精度を向上させるために2点フィードバック機構を採用する。
  • 収束保証を維持したままノイズのある関数評価を処理するためのスムージング技術を導入する。
  • 期待される勾配誤差が定数δで有界である(不正確なオーケストラ条件)という仮定の下で収束バウンドを導出する。
  • 凸および強凸設定の両方に対して適用し、それぞれ異なる収束レートを導出する。
  • 探索と収束のバランスを取るために、適切に調整されたステップサイズスケジュールを用いることで、最適なレグレットバウンドを保証する。

実験結果

リサーチクエスチョン

  • RQ1有界なノイズを伴う不正確なオーケストラ条件下でのゼロ次オンライン最適化の最適収束レートは何か?
  • RQ21点フィードバックと2点フィードバックの両方において、レグレットバウンドの観点から性能はどのように異なるか?
  • RQ3収束レートに与える影響が無視できるようになるノイズレベルはどの程度か?
  • RQ4関数値フィードバックのみで動作するオンライン設定へのミラー降下法の有効な一般化は可能か?
  • RQ5提案手法は、既知の情報理論的下界と一致するのか、つまり最適性を示すか?

主な発見

  • 1点フィードバックの場合、提案手法はレグレットバウンドが O(√(ln n / N)) に達し、既知の下界と対数要因を除いて一致する。
  • 2点フィードバックの場合、レグレットバウンドは O(ln n / N) に改善され、追加の関数評価の利点が明確に示された。
  • 関数評価が有界なノイズδで汚されている場合でも、この手法は有効であり、収束レートはδに制御された形で依存する。
  • 強凸の場合、レグレットバウンドは O(1/N) に改善され、線形収束レートを示す。
  • 理論的分析により、この手法が情報理論的複雑度の観点で最適であることが確認され、先行研究からの下界と一致する。
  • 結果から、ノイズが一定レベルδ未満であれば収束レートに顕著な影響がないことが示され、性能が著しく低下する閾値が特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。