Skip to main content
QUICK REVIEW

[論文レビュー] Variance Reduced Training with Stratified Sampling for Forecasting Models

Yucheng Lu, Youngsuk Park|arXiv (Cornell University)|Mar 2, 2021
Stock Market Forecasting Methods被引用数 5
ひとこと要約

本稿では、時系列予測のための分散低減型確率的最適化手法 SCott を提案する。この手法は、異種の時系列を同質な層に分類するための層別抽出を用い、勾配推定の分散を低減する。層別抽出と制御変数を組み合わせることで、SGD や Adam よりも反復回数および実行時間の両面で高速な収束を達成し、滑らかな非凸目的関数において理論的収束保証を有する。

ABSTRACT

In large-scale time series forecasting, one often encounters the situation where the temporal patterns of time series, while drifting over time, differ from one another in the same dataset. In this paper, we provably show under such heterogeneity, training a forecasting model with commonly used stochastic optimizers (e.g. SGD) potentially suffers large variance on gradient estimation, and thus incurs long-time training. We show that this issue can be efficiently alleviated via stratification, which allows the optimizer to sample from pre-grouped time series strata. For better trading-off gradient variance and computation complexity, we further propose SCott (Stochastic Stratified Control Variate Gradient Descent), a variance reduced SGD-style optimizer that utilizes stratified sampling via control variate. In theory, we provide the convergence guarantee of SCott on smooth non-convex objectives. Empirically, we evaluate SCott and other baseline optimizers on both synthetic and real-world time series forecasting problems, and demonstrate SCott converges faster with respect to both iterations and wall clock time.

研究の動機と目的

  • 異種時系列予測における確率的最適化の高分散勾配問題に対処すること。
  • 概念のずれや局所的要因による時系列の異種性が、SGD や Adam などの標準的最適化手法の学習を著しく遅くする可能性があることを示すこと。
  • モデルアーキテクチャの変更なしに、時系列を同質なグループに分類することで勾配分散を低減する手法を開発すること。
  • 制御変数と重み付きサンプリングを用いて、分散低減と計算複雑度のバランスを取った効率的な最適化手法を設計すること。
  • 滑らかな非凸目的関数において、提案手法の理論的収束保証を提供すること。

提案手法

  • 時系列の時間的パターンやダイナミクスの類似性に基づいて、時系列を同質なグループ(層)に分類し、勾配分散を低減すること。
  • 層全体での重み付きサンプリングを用い、分散低減と計算コストのバランスを取ること。
  • 各層内で制御変数を適用する SGD スタイルの最適化手法 SCott を導入すること。
  • 制御変数技術を活用し、過去の推定値を用いて確率的勾配を補正することで、安定性を向上させること。
  • 収束と分散のバランスを取るために、バッチサイズ $ B $ に比例するステップサイズスケジュール $ B^{-1/3} $ を使用すること。
  • テレスコピング和の技法とマルティングルの議論を用いて、滑らかな非凸目的関数下での収束バウンドを導出すること。

実験結果

リサーチクエスチョン

  • RQ1大規模時系列予測における時系列の異種性は、SGD や Adam などの標準的最適化手法において、勾配分散を無限大にまで引き上げる可能性があるか?
  • RQ2異種時系列を同質な層に分類することで、確率的最適化における勾配分散を低減できるか?
  • RQ3層別抽出と制御変数を組み合わせることで、標準的 SGD や Adam よりも効率的かつ安定した最適化手法が得られるか?
  • RQ4滑らかな非凸目的関数において、提案された SCott 最適化手法の理論的収束速度は何か?
  • RQ5収束速度および実行時間の観点で、SCott はベースライン最適化手法と比べてどのように差がつくか?

主な発見

  • SCott の収束速度は $ Oig((f(oldsymbol{0}) - ext{inf} f(oldsymbol{ heta}))L / (B^{1/3}T) + \text{sum of weighted variances} \big) $ であり、$ B $ はバッチサイズである。
  • 計算された確率的勾配の総数は $ Oig( \frac{\triangle L |\tilde{\boldsymbol{D}}|^{2/3}}{\tilde{\boldsymbol{\theta}}^2} \big) $ である。ここで $ \triangle = f(\boldsymbol{0}) - \text{inf} f(\boldsymbol{\theta}) $ である。
  • 実験結果から、合成データおよび実世界の時系列予測タスクにおいて、SGD や Adam、Adagrad よりも反復回数および実行時間の両面で SCott が高速に収束することが示された。
  • モデルアーキテクチャの変更や複数モデルの必要なしに、一般化性能を維持または向上させた。
  • 特に概念のずれや局所的要因が顕著な異種時系列では、勾配分散が顕著に低減された。
  • 理論的解析により、滑らかな非凸目的関数下でも収束が保証され、期待勾配ノルムの明示的バウンドが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。