Skip to main content
QUICK REVIEW

[論文レビュー] Online Optimization of Smoothed Piecewise Constant Functions

Vincent Cohen-Addad, Varun Kanade|arXiv (Cornell University)|Apr 7, 2016
Advanced Bandit Algorithms Research参考文献 16被引用数 5
ひとこと要約

本稿は、[0,1) 上の滑らかに処理された区分的定数関数に対する、非連続性が有界な不確実性(密度 ≤ σ)にさらされるオンライン最適化フレームワークを提案する。連続的な指数重み予測器と区間木データ構造を用いた効率的なアルゴリズムを提案し、完全情報設定では Õ(√T) のレグレットを達成し、バンドイット設定でも非線形レグレットを達成する。これは、目的関数が非リプシッツ的で、組合せ的非連続性を示す場合でも成立する。

ABSTRACT

We study online optimization of smoothed piecewise constant functions over the domain [0, 1). This is motivated by the problem of adaptively picking parameters of learning algorithms as in the recently introduced framework by Gupta and Roughgarden (2016). Majority of the machine learning literature has focused on Lipschitz-continuous functions or functions with bounded gradients. 1 This is with good reason---any learning algorithm suffers linear regret even against piecewise constant functions that are chosen adversarially, arguably the simplest of non-Lipschitz continuous functions. The smoothed setting we consider is inspired by the seminal work of Spielman and Teng (2004) and the recent work of Gupta and Roughgarden---in this setting, the sequence of functions may be chosen by an adversary, however, with some uncertainty in the location of discontinuities. We give algorithms that achieve sublinear regret in the full information and bandit settings.

研究の動機と目的

  • ナップサック問題、MWIS、k-means などの組合せ学習問題に現れる非リプシッツ的で区分的定数関数のオンライン最適化の課題に対処すること。
  • 既存手法がリプシッツ連続性や有界勾配を仮定しているため、非連続な目的関数では失敗するという制限を克服すること。
  • 非連続性の位置が有界な密度 σ 内で不確実である smoothed adversary モデル下で、no-regret のオンライン学習アルゴリズムを設計すること。
  • 目的関数に滑らかさがなくとも、完全情報設定およびバンドイット設定の両方で非線形レグレットを達成すること。
  • 1ラウンドあたり O(k log(kt)) の時間計算量を達成する計算効率の良いアルゴリズムを設計し、T に多項式的に依存する実行時間の回避を図ること。

提案手法

  • 敵対的選択を、密度 ≤ σ の分布から生成される非連続性を持つ区分的定数関数としてモデル化し、最悪ケースの「わらのなかの針」的状況を避けるために不確実性を導入する。
  • コアなアルゴリズムメカニズムとして、区分的定数報酬関数を扱えるように適合された連続的指数重み予測器を用いる。
  • 区間木または赤黒木を用いて、アクティブな区間を効率的に維持・照会し、1ラウンドあたり O(k log(kt)) の更新時間の実現を図る。
  • バンドイット設定では、Exp.4 にインspired した技術を用いて拡張し、部分的フィードバック下でも非線形レグレットを維持する。
  • ドメイン [0,1) 上で動的区間更新と点クエリをサポートするデータ構造を設計し、重みの維持と効率的な行動選択を可能にする。
  • パラメータ ρ を持つパラメータ化された関数として、その貪欲法ヒューリスティクスをモデル化することで、ナップサック問題、最大重み付き独立集合、重み付き k-means への応用を実現する。

実験結果

リサーチクエスチョン

  • RQ1組合せ機械学習問題に現れる非リプシッツ的で区分的定数関数に対して、オンライン最適化を効果的に行うことは可能か?
  • RQ2非連続性の位置に有界な不確実性(smoothed adversary)を導入することで、非連続性が存在してもオンライン学習において非線形レグレットを達成できるか?
  • RQ3目的関数が非連続であっても、1ラウンドあたり多項対数時間で実行可能な効率的オンラインアルゴリズムを設計できるか?
  • RQ4smoothed adversary モデル下で、完全情報設定およびバンドイット設定において達成可能な最適なレグレットバウンドは何か?
  • RQ5提案されたアルゴリズムは、ナップサック問題、MWIS、重み付き k-means といった実世界の問題に対して、最悪ケースの境界と比較してどのように性能を発揮するか?

主な発見

  • 提案されたアルゴリズムは、smoothed adversary モデル下で完全情報設定において Õ(√T) のレグレットを達成し、オンライン学習の最適境界に近い性能を示す。
  • アルゴリズムは 1ラウンドあたり O(k log(kt)) の時間で実行され、T に多項式的に依存する実装とは異なり、計算的に効率的でスケーラブルである。
  • ナップサック問題、MWIS、重み付き k-means における実験的結果から、1ラウンドあたりのレグレットが急速に減少し、最悪ケースの理論的境界を著しく下回ることが示された。
  • 100回の実験ランでレグレットの分散が非常に小さく、ランダムなインスタンス下でもアルゴリズムの強靭性と安定性が裏付けられた。
  • 標準的なリプシッツに基づく手法が失敗する k-means や独立集合問題のような非滑らかで組合せ的非連続な目的関数に対しても、フレームワークが効果的に対処できた。
  • smoothed adversary モデルにより、すべての最適点を含む最小の区間が T に対して多項式的に小さくなることが保証され、学習の情報理論的不可能性を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。