Skip to main content
QUICK REVIEW

[論文レビュー] Iterate averaging as regularization for stochastic gradient descent

Gergely Neu, Lorenzo Rosasco|arXiv (Cornell University)|Feb 22, 2018
Stochastic Gradient Optimization Techniques被引用数 16
ひとこと要約

本稿では、線形最小二乗回帰の正則化手法として、勾配降下法(SGD)の反復値に対して幾何的に減衰する重みを用いた重み付き平均である幾何的Polyak–Ruppert平均を提案する。この手法は漸近的にリッジ回帰と同等であり、既存の正則化SGDで得られている最良の結果と一致する有限標本予測誤差バインディングを達成する。これにより、減衰率を調整することでバイアス・バリアンストレードオフを体系的かつ原理的につなじめる手法が提供される。

ABSTRACT

We propose and analyze a variant of the classic Polyak-Ruppert averaging scheme, broadly used in stochastic gradient methods. Rather than a uniform average of the iterates, we consider a weighted average, with weights decaying in a geometric fashion. In the context of linear least squares regression, we show that this averaging scheme has a the same regularizing effect, and indeed is asymptotically equivalent, to ridge regression. In particular, we derive finite-sample bounds for the proposed approach that match the best known results for regularized stochastic gradient methods.

研究の動機と目的

  • SGDの反復値に幾何的に減衰する重みを適用する新しい平均化スキームを考案し、反復値の重み付き平均として正則化を実現する。
  • 幾何的平均化とTikhonov(リッジ)正則化との間の理論的同等性を、漸近的極限において確立する。
  • 提案手法の有限標本予測誤差バインディングを導出し、正則化SGDで得られている最良の既知の結果と一致させることを目的とする。
  • 尾部平均化などの他の平均化戦略と比較して、幾何的平均化がいつ優れるかを実用的な指針を提供する。
  • 保存された反復値を用いた1回のSGD走行から、全正則化パスを効率的に計算可能にすることで、モデル選択を容易にする。

提案手法

  • 幾何的に減衰する重みを用いたSGD反復値の重み付き平均を提案:$ \widetilde{w}_n = c_n \sum_{t=0}^n (1 - \gamma\lambda)^t w_t $、ここで$ c_n $は正規化定数である。
  • ヒルバート空間フレームワークを用いて、線形最小二乗回帰の文脈でこの手法を分析し、データ分布を共分散作用素$ \Sigma $でモデル化する。
  • 過剰リスク$ \mathbb{E}[\Delta(\widetilde{w}_n)] = \mathbb{E}[\|\Sigma^{1/2}(\widetilde{w}_n - w^*)\|^2] $を導出し、ミンコフスキーおよびトレース不等式を用いてバインディングする。
  • 誤差を「ノイズなし」成分(バイアス)と「純粋なノイズ」成分(バリアンス)に分解し、それぞれを作用素ノルムおよびトレース項を用いて別々にバインディングする。
  • 鍵となる恒等式$ w_t - w^* = M_{0,t}(w_0 - w^*) + \eta \sum_{j=1}^t M_{j,t} \varepsilon_j x_j $を用いる。ここで$ M_{j,t} $は更新作用素の積行列である。
  • 幾何的平均化スキームが、正則化パラメータ$ \lambda $を用いたTikhonov正則化最小二乗問題を漸近的に解くことと同等であることを確立する。

実験結果

リサーチクエスチョン

  • RQ1SGD反復値の幾何的平均化は、リッジ回帰と同等の正則化効果を生じるか?
  • RQ2幾何的平均化の有限標本予測誤差バインディングは、正則化SGDで得られている最良の結果と一致するか?
  • RQ3幾何的重みの減衰率が推定量におけるバイアス・バリアンストレードオフにどのように影響するか?
  • RQ4どのようなデータ環境(例えば、小標本または悪条件な場合)において幾何的平均化は尾部平均化を上回るか?
  • RQ51回のSGD走行と保存された反復値から、モデル選択のための全正則化パスを効率的に生成できるか?

主な発見

  • 幾何的Polyak–Ruppert平均は、減衰率$ \gamma $によって決定される正則化パラメータ$ \lambda $を用いたTikhonov正則化最小二乗問題と漸近的に同等である。
  • 本手法の有限標本予測誤差バインディングは、正則化SGDで得られている最良の既知の結果と一致し、Tsybakov(2008)が定義する最適レートを達成する。
  • 過剰リスクは、$ \mathrm{tr}\left[\Sigma(\Sigma + \lambda I)^{-1}(\Sigma + \frac{\lambda}{2}I)^{-1}E_0\right] $ を含む項によってバインディングされ、ここで$ E_0 = \mathbb{E}[\|w_0 - w^*\|^2] $ は初期バイアスを捉える。
  • バリアンス成分は$ \frac{\eta \sigma^2}{2 - \eta R^2} \cdot \mbox{tr}[\Sigma^2(\Sigma + \lambda I)^{-2}] $ によってバインディングされ、ノイズへの感受性を制御する。
  • 正規化定数$ c_n $は$ c_n^2 \leq \frac{1}{\gamma^2} \cdot \frac{1}{(1 - (1 - \gamma\lambda)^n)^2} $ を満たし、適切な減衰条件下で収束を保証する。
  • 本手法により、1回のSGD走行で保存された反復値から、複数の正則化レベルを後で効率的に計算可能となり、並列的かつスケーラブルなモデル選択を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。