Skip to main content
QUICK REVIEW

[論文レビュー] First-Order Adaptive Sample Size Methods to Reduce Complexity of Empirical Risk Minimization

Aryan Mokhtari, Alejandro Ribeiro|arXiv (Cornell University)|Sep 2, 2017
Stochastic Gradient Optimization Techniques被引用数 6
ひとこと要約

本稿では、最初に小さなサブサンプルを用いて段階的にそれを幾何級数的に拡大することで、計算複雑性を低減するための適応的サンプルサイズ手法を提案する。ウォームスタートと適応的正則化を用いることで条件数を改善し、加速勾配降下法やSVRGといった標準的な一階法と比較して勾配評価回数を対数的(log(N^α))に削減する。

ABSTRACT

This paper studies empirical risk minimization (ERM) problems for large-scale datasets and incorporates the idea of adaptive sample size methods to improve the guaranteed convergence bounds for first-order stochastic and deterministic methods. In contrast to traditional methods that attempt to solve the ERM problem corresponding to the full dataset directly, adaptive sample size schemes start with a small number of samples and solve the corresponding ERM problem to its statistical accuracy. The sample size is then grown geometrically -- e.g., scaling by a factor of two -- and use the solution of the previous ERM as a warm start for the new ERM. Theoretical analyses show that the use of adaptive sample size methods reduces the overall computational cost of achieving the statistical accuracy of the whole dataset for a broad range of deterministic and stochastic first-order methods. The gains are specific to the choice of method. When particularized to, e.g., accelerated gradient descent and stochastic variance reduce gradient, the computational cost advantage is a logarithm of the number of training samples. Numerical experiments on various datasets confirm theoretical claims and showcase the gains of using the proposed adaptive sample size scheme.

研究の動機と目的

  • 一階法を用いた大規模なERM問題の解法における高い計算コストを低減すること。
  • 真のリスク最小化の代理としてのERMの統計的精度を活用し、意味のある収束を超えて最適化しすぎることを避けること。
  • 異なるサンプルサイズにおけるERM問題の構造的類似性を活用して収束効率を向上させること。
  • 訓練サブセットの幾何的増大とウォームスタートを活用することで、全体の計算複雑性を低減する手法を開発すること。
  • 確定的および確率的両方の一階法がERMに適用された場合の収束境界の改善を達成すること。

提案手法

  • 初期に小さなサンプルサイズを設定し、そのサブセット上でERM問題をその統計的精度まで解く。
  • 強凸性を保証し条件数$ \kappa_n $を改善するために、$ V_n = \gamma / n^\alpha $の順序の適応的正則化を用いるが、ターゲットの精度は変更しない。
  • サンプルサイズを幾何級数的に増大(例:各ステップで倍加)させ、直前の段階の解を次の段階のウォームスタートとして使用する。
  • 各部分問題に対して加速勾配降下法(AGD)やSVRGなどの一階法を適用し、改善された条件数に基づいた収束境界を導出する。
  • 各段階で$ s_n $回の反復を要し、$ s_n $が$ n $に関して対数的にスケーリングされることで、全データセットの統計的精度内に収束することを保証する。
  • 全段階にわたる計算複雑性を合算することで、標準的手法と比較して$ \log(N^\alpha) $の要因で全体の複雑性が低減することを示す。

実験結果

リサーチクエスチョン

  • RQ1適応的サンプルサイズスキームは、標準的な有限和最小化の境界を超えて、一階法によるERM問題の全体的な計算複雑性を低減できるか?
  • RQ2訓練サブセットの幾何的増大とウォームスタートを組み合わせることで、収束速度と総勾配評価回数にどのような影響を与えるか?
  • RQ3適応的正則化は、統計的精度に影響を与えずに条件数をどれほど改善できるか? その結果、反復回数がどれほど削減されるか?
  • RQ4このスキームを加速勾配降下法やSVRGに適用した場合、理論的な計算複雑性の向上はどの程度か?
  • RQ5総計算コストを低減しつつ、全データセットの統計的精度に収束するか、この手法はその保証を満たすか?

主な発見

  • 適応的サンプルサイズ手法により、加速勾配降下法(AGD)の全体的な計算複雑性が$ \mathcal{O}(N\sqrt{\kappa}) $に低減され、標準的なAGDに見られる$ \log(N^\alpha) $要因が排除された。
  • SVRGの場合、勾配計算の総数は$ 4N \log_2\left[3 \cdot 2^\alpha + (2^\alpha - 1)(2 + c\|\mathbf{w}^*\|^2/2)\right] $で抑えられ、段階数に依存せず$ N $に線形にスケーリングされる。
  • ERMの統計的精度と、成長するサンプルサイズ間でのERM問題の類似性を活用することで、複雑性が対数的($ \log(N^\alpha) $)に低減された。
  • 理論的分析により、各段階の反復回数$ s_n $が$ n $に関して対数的にスケーリングされ、全コストが$ N \log N $ではなく定数倍の$ N $で抑えられることを示した。
  • 数値実験により理論的主張が確認され、標準的一階法と比較して、さまざまなデータセットで顕著な高速化が達成された。
  • 従来の適応的スキームが強凸性を要件としていたのに対し、本手法は凸関数および非強凸関数にも適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。