Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchically Compositional Kernels for Scalable Nonparametric Learning

Jie Chen, Haim Avron|arXiv (Cornell University)|Aug 2, 2016
Sparse and Compressive Sensing Techniques参考文献 40被引用数 3
ひとこと要約

本稿では、データドメインの階層的分割を用い、Nyströmに基づくグローバルな低ランク近似と局所的な損失なし近似を組み合わせることで、スケーラブルな非パrametric学習を可能にする階層的構成型カーネルを導入する。得られるカーネル行列は、再帰的な非対角ブロックの低ランク構造を示し、トレーニングメモリと算術的複雑性をそれぞれ $O(n^2)$ と $O(n^3)$ から $O(nr)$ と $O(nr^2)$ に低減するが、厳密な正定値性を維持し、他の近似カーネルと比較してより小さなランク $r$ で競争力ある性能を達成する。

ABSTRACT

We propose a novel class of kernels to alleviate the high computational cost of large-scale nonparametric learning with kernel methods. The proposed kernel is defined based on a hierarchical partitioning of the underlying data domain, where the Nyström method (a globally low-rank approximation) is married with a locally lossless approximation in a hierarchical fashion. The kernel maintains (strict) positive-definiteness. The corresponding kernel matrix admits a recursively off-diagonal low-rank structure, which allows for fast linear algebra computations. Suppressing the factor of data dimension, the memory and arithmetic complexities for training a regression or a classifier are reduced from $O(n^2)$ and $O(n^3)$ to $O(nr)$ and $O(nr^2)$, respectively, where $n$ is the number of training examples and $r$ is the rank on each level of the hierarchy. Although other randomized approximate kernels entail a similar complexity, empirical results show that the proposed kernel achieves a matching performance with a smaller $r$. We demonstrate comprehensive experiments to show the effective use of the proposed kernel on data sizes up to the order of millions.

研究の動機と目的

  • 大規模なカーネル手法の高い計算コストに対処すること。これは、$n$ が増加するにつれて、密で構造のないカーネル行列のため、スケーリングが著しく悪化するためである。
  • 構造化された低ランク近似を通じて効率的な計算を可能にしつつ、厳密な正定値性を維持するカーネル構築法を開発すること。
  • 階層的データ分割を活用することで、カーネルリッジ回帰および分類のメモリと算術的複雑性をそれぞれ $O(n^2)$ と $O(n^3)$ から $O(nr)$ と $O(nr^2)$ に低減すること。
  • 標準的なカーネル手法が非効率になるような、数百万点に達するデータセットに対してもカーネル手法の有効な使用を可能にすること。
  • 最大尤度を介した原理的パrameter推定をサポートし、高次元設定下でもカーネルハイパーパrameterの最適化を可能にすること。

提案手法

  • 本手法は、データドメインをネストされたクラスタに階層的に分割することで、非対角ブロックの再帰的低ランク近似を可能にする。
  • グローバルな低ランク近似にNyström法を用い、各パーティション内での局所的・損失なしのカーネル評価を組み合わせることで、精度と正定値性を維持する。
  • カーネル行列は、非対角ブロックが低ランクであるように構造化されており、再帰的行列因子分解を介して高速な線形代数演算を可能にする。
  • 構造的設計により、厳密な正定値性が保証され、ガウス過程やカーネルリッジ回帰フレームワークでの使用が可能になる。
  • 出展外予測は、明示的なカーネル関数と階層的パーティショニングのおかげで容易であり、新しい点のクラスタ所属は、重心までの距離に基づいて定義される。
  • 再帰的低ランク行列のための特殊なアルゴリズムにより、対数行列式および行列逆行列の項の効率的計算が可能となり、スケーラブルな最大尤度推定が実現される。

実験結果

リサーチクエスチョン

  • RQ1大規模データに対して、厳密な正定値性を維持しつつ、カーネル手法のメモリ量を $O(n^2)$ 未満、算術的複雑性を $O(n^3)$ 未満に抑えるカーネルを構築できるか?
  • RQ2階層的パーティショニングと低ランク近似をどのように組み合わせれば、カーネルの精度を維持しつつ計算コストを低減できるか?
  • RQ3提案されたカーネルは、より小さなランク $r$ で、他の確率的近似カーネルと同等またはそれ以上の性能を達成できるか?
  • RQ4カーネル行列の再帰的低ランク構造を活用して、カーネルハイパーパrameterのための効率的な最大尤度推定を可能にできるか?
  • RQ5本手法は、最大数百万点のデータセットにスケーラブルであり、実際の応用において、標準的なカーネル手法と比較してどのように性能を発揮するか?

主な発見

  • 提案されたカーネルは、トレーニングメモリと算術的複雑性をそれぞれ $O(n^2)$ と $O(n^3)$ から $O(nr)$ と $O(nr^2)$ に低減するが、$r$ は階層的レベルごとのランクを示す。
  • 実騴結果から、他の近似カーネルと同等またはそれ以上の性能を達成する一方で、より小さなランク $r$ で実現可能であることが示され、高い効率性が裏付けられた。
  • カーネル行列の構造により、再帰的アルゴリズムを介した対数行列式および行列逆行列の項の高速計算が可能となり、スケーラブルな最大尤度推定が可能になった。
  • 本手法は、例数が数百万規模に達するデータセットに対しても有効であり、通常のカーネル手法の限界を超えた実用的スケーラビリティを示した。
  • カーネルは厳密な正定値性を維持しており、すべてのカーネルベース学習およびガウス過程推論タスクにおける有効性が保証された。
  • 出展外拡張は容易であり、新しい点のパーティション所属は、階層的パーティショニングにおけるクラスタ中心までの最小距離によって定義される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。