Skip to main content
QUICK REVIEW

[論文レビュー] Diving into the shallows: a computational perspective on large-scale shallow learning

Siyuan Ma, Mikhail Belkin|arXiv (Cornell University)|Mar 30, 2017
Stochastic Gradient Optimization Techniques参考文献 18被引用数 10
ひとこと要約

この論文は、大規模なカーネル法における滑らかなカーネルと勾配降下法を組み合わせた際の根本的な計算的制限を特定する。具体的には、多項式時間内に近似可能な関数は非常に滑らかすぎるため、著しいアンダーフィッティングが生じる。これを克服するために、著者らはEigenPro反復法を提案する。これは、少数の近似固有ベクトルを用いるシンプルでSGDと互換性のある正規化手法であり、収束性と性能を顕著に向上させ、計算コストを著しく抑えることで、最先端の結果に匹敵またはそれを上回る性能を達成する。

ABSTRACT

In this paper we first identify a basic limitation in gradient descent-based optimization methods when used in conjunctions with smooth kernels. An analysis based on the spectral properties of the kernel demonstrates that only a vanishingly small portion of the function space is reachable after a polynomial number of gradient descent iterations. This lack of approximating power drastically limits gradient descent for a fixed computational budget leading to serious over-regularization/underfitting. The issue is purely algorithmic, persisting even in the limit of infinite data. To address this shortcoming in practice, we introduce EigenPro iteration, based on a preconditioning scheme using a small number of approximately computed eigenvectors. It can also be viewed as learning a new kernel optimized for gradient descent. It turns out that injecting this small (computationally inexpensive and SGD-compatible) amount of approximate second-order information leads to major improvements in convergence. For large data, this translates into significant performance boost over the standard kernel methods. In particular, we are able to consistently match or improve the state-of-the-art results recently reported in the literature with a small fraction of their computational budget. Finally, we feel that these results show a need for a broader computational perspective on modern large-scale learning to complement more traditional statistical and convergence analyses. In particular, many phenomena of large-scale high-dimensional inference are best understood in terms of optimization on infinite dimensional Hilbert spaces, where standard algorithms can sometimes have properties at odds with finite-dimensional intuition. A systematic analysis concentrating on the approximation power of such algorithms within a budget of computation may lead to progress both in theory and practice.

研究の動機と目的

  • 大規模データセットにおける滑らかなカーネル法に対する勾配降下法の主要なアルゴリズム的制限を特定・分析すること。
  • 標準的な勾配降下法が、実用的な計算時間内に滑らかでない、現実的なターゲット関数を近似できない理由を説明すること。
  • 完全な2次情報に依存しない、実用的で効率的なアルゴリズムを開発し、この制限を克服すること。
  • 単純なアルゴリズム的修正が、大規模データにおける浅い学習法の性能を顕著に向上させられることを示すこと。
  • 従来の統計的分析に加えて、大規模学習における計算的視点を提唱すること。

提案手法

  • カーネル行列の少数の近似固有ベクトルを用いる、正規化勾配降下法としてのEigenPro反復法を提案する。
  • 滑らかなカーネルのスペクトル特性を用いて、勾配降下法が速やかにスペクトルが減少するため、収束が遅く、到達可能な関数空間が制限されることを示す。
  • 無限次元ヒルベルト空間で問題を定式化することで、問題が統計的ではなくアルゴリズム的であることが明らかになり、無限データでも同様の問題が継続することを示す。
  • 計算効率が良く、SGDと互換性がある方法を導入し、低ランク固有空間を用いてヘッシアンを近似することで収束速度を向上させる。
  • カーネルリッジ回帰と分類にこの手法を適用し、複数のデータセットで一貫した性能向上を示す。
  • ランダムフーリエ特徴量を用いて、精度と効率を保ちながら大規模データセットへのスケーリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1なぜ標準的な勾配降下法は、大規模データセットにおける滑らかなカーネル法に適用した際に、効率的に収束しないのか?
  • RQ2滑らかなカーネルに対する勾配降下法に、アンダーフィッティングと過剰正則化を引き起こす根本的なアルゴリズム的制限は何か?
  • RQ31次情報法に単純で低コストの修正を加えることで、十分な2次情報を取り入れ、大規模カーネル学習における収束を顕著に改善できるか?
  • RQ4そのような修正が、計算予算の僅か数分の1で、最先端の性能に匹敵またはそれを上回るまでの到達はどの程度可能か?
  • RQ5カーネルの滑らかさとターゲット関数の滑らかでなさの不一致は、実用的な分類タスクにおいて一般的で深刻な問題であるか?

主な発見

  • 滑らかなカーネルを用いた勾配降下法は、スペクトルの急激な減少のため、多項式時間内に到達可能な関数空間の部分集合が極めて小さくなる。
  • アルゴリズム的制約のため、無限データでも、滑らかでないターゲット関数を実用的な反復回数内で近似できない。
  • 少数の近似固有ベクトルを用いたEigenPro反復法は、収束速度とモデル精度を顕著に向上させる。
  • MNISTでは、4.8 GPU時間で0.70%のテスト誤差を達成し、最先端の結果(0.72%)に匹敵するが、時間は15分の1で、エポック数も少ない。
  • TIMITでは、3.2 GPU時間で31.7%の誤差を達成し、512コアまたは1024 vCPUで7.5時間が必要だった先行研究を上回る。
  • SUSYでは、0.1 GPU時間で19.8%の誤差を達成し、IBM POWER8で0.6時間が必要だった先行手法を著しく上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。