Skip to main content
QUICK REVIEW

[論文レビュー] FALKON: An Optimal Large Scale Kernel Method

Alessandro Rudi, Luigi Carratino|arXiv (Cornell University)|May 31, 2017
Machine Learning and Data Classification被引用数 19
ひとこと要約

FALKONは、Nyström近似、条件付けられた共役勾配ソルバー、および確率的サブサンプリングを組み合わせることで、O(n)のメモリとO(n√n)の時間計算量を実現する、大規模学習における新しいカーネル法を提案する。この手法は、単一マシン環境でも、分散処理を用いた手法を凌駆する効率性と正確性を示し、数百万件のデータポイントに対して優れた性能を発揮する。

ABSTRACT

Kernel methods provide a principled way to perform non linear, nonparametric learning. They rely on solid functional analytic foundations and enjoy optimal statistical properties. However, at least in their basic form, they have limited applicability in large scale scenarios because of stringent computational requirements in terms of time and especially memory. In this paper, we take a substantial step in scaling up kernel methods, proposing FALKON, a novel algorithm that allows to efficiently process millions of points. FALKON is derived combining several algorithmic principles, namely stochastic subsampling, iterative solvers and preconditioning. Our theoretical analysis shows that optimal statistical accuracy is achieved requiring essentially $O(n)$ memory and $O(n\sqrt{n})$ time. An extensive experimental analysis on large scale datasets shows that, even with a single machine, FALKON outperforms previous state of the art solutions, which exploit parallel/distributed architectures.

研究の動機と目的

  • カーネル法が大規模学習の場面で直面する計算およびメモリのボトル neck を解消すること。
  • 時間的・空間的計算量を明示的に削減することで、最適な統計的精度(最小の過剰リスク)を達成すること。
  • Nyström近似、反復的ソルバー、および条件付けを統合した、カーネルリッジ回帰のための効率的なアルゴリズムを構築すること。
  • 単一マシン上でも、二次未満の計算量で最適な統計的性能を達成できることを示すこと。
  • 標準的および良性な条件下で、収束速度および一般化誤差に関する理論的保証を提供すること。

提案手法

  • FALKONは、リーディングスコアまたは一様抽出を用いてM個のランドマークポイントを選択することで、カーネル行列のサイズを縮小するNyström近似を用いる。
  • 低ランク近似に基づくNyström近似から導出される条件付けを用いて、縮小された線形システムの共役勾配解法を高速化する。
  • アルゴリズムは、条件付けられたシステムに適用する反復的Krylov部分空間法(共役勾配)を用いて、カーネルリッジ回帰問題を解く。
  • 条件付けは、カーネル行列の低ランク近似のコレスキー分解を用いて構築され、効率的な行列・ベクトル積を可能にする。
  • ランダム化線形代数技術を活用して、Nyströmの中心点とその重みを効率的に計算し、計算コストを低減する。
  • 過学習を回避し、最小限の反復回数で最適な一般化性能を達成するために、共役勾配法における早期停止を用いる。

実験結果

リサーチクエスチョン

  • RQ1時間的・空間的計算量がO(n²)未満であるカーネル法が、最適な統計的精度を達成できるか?
  • RQ2Nyström近似を条件付けられた反復的ソルバーと効果的に組み合わせることで、カーネル法を数百万点にスケーリングできるか?
  • RQ3提案手法が標準的および良性な条件下でも、最適な一般化誤差率を維持できるか?
  • RQ4単一マシン実装が、並列または分散処理を用いた手法を、速度および正確性の両面で凌駆できるか?
  • RQ5異なるサンプリング戦略(例:一様抽出対リーディングスコア抽出)が、アルゴリズムの性能および収束に与える影響は何か?

主な発見

  • FALKONは、対数要因を除き、O(n√n)の時間計算量とO(n)のメモリ計算量で、最適な統計的精度を達成する。
  • FALKONは、分散または並列アーキテクチャを用いた既存の最先端手法でさえも、大規模データセットにおいて上回る性能を示す。
  • 単一マシン上でも、FALKONは既存のスケーラブルなカーネル手法よりも高い予測精度とより速い学習時間を達成する。
  • Nyströmの中心点にリーディングスコア抽出を用いることで、一様抽出に比べて収束性と一般化性能が向上する。
  • 理論的分析により、FALKONが標準的および良性な条件下で、正確なカーネルリッジ回帰と同等の最適な過剰リスクレートを達成することが確認された。
  • 実験的結果から、FALKONは大規模な非線形学習タスクにおいて、深く完全結合されたニューラルネットワークの代替手段として実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。