Skip to main content
QUICK REVIEW

[論文レビュー] General multilevel adaptations for stochastic approximation algorithms

Steffen Dereich|arXiv (Cornell University)|Jun 17, 2015
Stochastic Gradient Optimization Techniques参考文献 23被引用数 9
ひとこと要約

本稿では、期待値関数 $ f(\theta) = \mathbb{E}[F(\theta, U)] $ のゼロを計算するための普遍的なマルチレベル適応型確率的近似アルゴリズムを導入する。ここで $ F(\theta, U) $ はマルチレベル・モンテカルロによって近似される。ロビンズ=モンローおよびポリャク=ルッパー則にマルチレベル分散低減を統合することで、標準的なバイアス、モーメント、コストの仮定のもとで、古典的なマルチレベル・モンテカルロと同等の $ p $-乗平均誤差の減少率を達成し、最適な計算複雑度を実現する。

ABSTRACT

In this article we present and analyse new multilevel adaptations of stochastic approximation algorithms for the computation of a zero of a function $f\colon D o \mathbb R^d$ defined on a convex domain $D\subset \mathbb R^d$, which is given as a parameterised family of expectations. Our approach is universal in the sense that having multilevel implementations for a particular application at hand it is straightforward to implement the corresponding stochastic approximation algorithm. Moreover, previous research on multilevel Monte Carlo can be incorporated in a natural way. This is due to the fact that the analysis of the error and the computational cost of our method is based on similar assumptions as used in Giles (2008) for the computation of a single expectation. Additionally, we essentially only require that $f$ satisfies a classical contraction property from stochastic approximation theory. Under these assumptions we establish error bounds in $p$-th mean for our multilevel Robbins-Monro and Polyak-Ruppert schemes that decay in the computational time as fast as the classical error bounds for multilevel Monte Carlo approximations of single expectations known from Giles (2008).

研究の動機と目的

  • 期待値の評価に高コストなシミュレーションを要する場合の、標準的確率的近似の計算非効率性を是正すること。
  • 既存のマルチレベル・モンテカルロ実装をスムーズに確率的近似アルゴリズムに統合できる普遍的なフレームワークを開発すること。
  • マルチレベル確率的近似における $ p $-乗平均誤差の最適収束速度を達成し、単一期待値のマルチレベル・モンテカルロで知られている最良の境界と一致させること。
  • 標準的ロビンズ=モンロー法で必要な収縮定数 $ L $ の事前知識を回避するため、ポリャク=ルッパー平均化スキームを導入すること。
  • 最小限の仮定のもとで誤差および計算コストに関する理論的保証を確立し、一般の凸領域およびヒルベルト空間への適用可能性を拡張すること。

提案手法

  • $ (n+1) $-番目のステップで $ \mathbb{E}[F(\theta_n, U)] $ のマルチレベル推定値を用いる、1つのマルチレベル・ロビンズ=モンロー法を提案。レベルの複雑度は時間とともに増加する。
  • ギルズ [7] のマルチレベル・モンテカルロと同一のバイアス、$ p $-次中心モーメント、シミュレーションコストに関する仮定を採用し、既存のマルチレベル実装と互換性を保つ。
  • 収縮性の性質を組み込む:$ \langle f(\theta), \theta - \theta^* \rangle \leq -L\|\theta - \theta^*\|^2 $。これによりゼロ $ \theta^* $ の一意性と安定性が保証される。
  • 収縮定数 $ L $ を事前に知らなくてもよいように、ポリャク=ルッパー平均化スキームを導入。これにより、非効率を損なわず最適な収束速度を維持できる。
  • 付録で証明された修正されたバーグホルダー=デイヴィス=ギュンデイ不等式を用いて、誤差過程の鋭い $ p $-次モーメントの境界を導出する。
  • 結果を $ \mathbb{R}^d $ から任意の閉凸領域 $ D \subset \mathbb{R}^d $ に一般化し、すべての結果が分離可能なヒルベルト空間へ形式的に拡張可能であることを指摘する。

実験結果

リサーチクエスチョン

  • RQ1マルチレベル・モンテカルロの分散低減を、計算効率を高めるために、確率的近似アルゴリズムに体系的に統合できるか?
  • RQ2バイアス、モーメント、コストに関する標準的マルチレベル仮定のもとで、マルチレベル確率的近似の誤差境界をどのように確立できるか?
  • RQ3マルチレベル・ロビンズ=モンロー法の $ p $-乗平均誤差の減少率は、古典的確率的近似と比べてどのように異なるか?
  • RQ4収縮定数 $ L $ を事前に知る必要をなくすことは可能か?もし可能であれば、その方法は何か?
  • RQ5このフレームワークは $ \mathbb{R}^d $ を超えてどの程度一般化可能か?また、無限次元ヒルベルト空間へは拡張可能か?

主な発見

  • マルチレベル・ロビンズ=モンロー法は、ギルズ [7] で確立された単一期待値のマルチレベル・モンテカルロと同等の $ p $-乗平均誤差の減少率を達成する。標準的仮定のもとで成立する。
  • 最大 $ p $-乗平均誤差 $ \sup_{k \geq n} \mathbb{E}[\|\theta_k - \theta^*\|^p] $ は、古典的マルチレベル・モンテカルロと同一の速度で減少し、最適な計算複雑度の境界と一致する。
  • マルチレベルアルゴリズムのポリャク=ルッパー平均は、$ L $ の知識がなくても、$ q < p $ に対して、ロビンズ=モンロー法と同等の $ q $-乗平均誤差の減少率を達成する。
  • 誤差解析は、付録で確立された新しい応用形の修正バーグホルダー=デイヴィス=ギュンデイ不等式に依拠している。
  • このフレームワークは普遍的である。$ F(\theta, U) $ に対してマルチレベル実装が存在する限り、対応する確率的近似アルゴリズムは最小限の追加コードで実装可能である。
  • すべての理論的結果は、$ \mathbb{R}^d $ の場合と同様に、分離可能なヒルベルト空間へ形式的に拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。