Skip to main content
QUICK REVIEW

[論文レビュー] Practical Leverage-Based Sampling for Low-Rank Tensor Decomposition

Brett W. Larsen, Tamara G. Kolda|arXiv (Cornell University)|Jun 30, 2020
Tensor decomposition and applications被引用数 4
ひとこと要約

本稿では、マトリクススケッチを用いた低ランクテンソル分解の高速化を目的として、実用的な利得スコアに基づくサンプリング手法を提案する。利得スコアの上界を、カトライ・ラオ積構造を効率的に用いて計算し、その上界に比例して行をサンプリングすることで、テンソルサイズに依存しない O(rd/ϵ) のサンプリング複雑度を達成する。これにより、大規模なスパーステンソルにおいて、決定的手法と比較して高い精度を維持しながら顕著な高速化が可能になる。

ABSTRACT

The low-rank canonical polyadic tensor decomposition is useful in data analysis and can be computed by solving a sequence of overdetermined least squares subproblems. Motivated by consideration of sparse tensors, we propose sketching each subproblem using leverage scores to select a subset of the rows, with probabilistic guarantees on the solution accuracy. We randomly sample rows proportional to leverage score upper bounds that can be efficiently computed using the special Khatri-Rao subproblem structure inherent in tensor decomposition. Crucially, for a $(d+1)$-way tensor, the number of rows in the sketched system is $O(r^d/ε)$ for a decomposition of rank $r$ and $ε$-accuracy in the least squares solve, independent of both the size and the number of nonzeros in the tensor. Along the way, we provide a practical solution to the generic matrix sketching problem of sampling overabundance for high-leverage-score rows, proposing to include such rows deterministically and combine repeated samples in the sketched system; we conjecture that this can lead to improved theoretical bounds. Numerical results on real-world large-scale tensors show the method is significantly faster than deterministic methods at nearly the same level of accuracy.

研究の動機と目的

  • 大規模かつスパースなテンソルにおける低ランク CANDECOMP/PARAFAC (CP) テンソル分解の高速化を目的とする。
  • 交互最小二乗法 (ALS) の反復処理における計算コストを、利得スコアを用いたスケッチにより、最小二乗部分問題を簡略化することで低減する。
  • 密なテンソルや行列を明示的に構築することなく、実用的でスケーラブルな手法を開発する。
  • 高利得スコアの行を効果的に処理するため、決定的包含と繰り返しサンプリングを組み合わせる。
  • サンプリングの下で解の精度に関する確率的境界を含む理論的保証を提供する。

提案手法

  • カトライ・ラオ積構造から導かれる利得スコアの上界を用いて、最小二乗部分問題における行のサンプリングを誘導する。
  • ハイブリッドサンプリング戦略を適用:高利得スコアの行を決定的に含め、他の行は利得スコア上界に比例する確率で確率的サンプリングを行う。
  • 同じ行からの繰り返しサンプルを、スケッチされたシステム内での1つの有効な行に統合することで、数値的安定性と効率性を向上させる。
  • Ω, Z, X を明示的に構築せずに、スケッチ行列 ˜Z = ΩZ と ˜X⊺ = ΩX⊺ を計算することで、スパース行列演算を可能にする。
  • ランダム化数値線形代数 (RandNLA) 技法を用いて、スケッチされた最小二乗問題を O(max{n,r}rd+1/ϵ) 時間で解く。
  • 初期化段階でのファイバーの効率的サンプリングを可能にするために、各モードに沿ったテンソル要素の線形インデックスを事前処理で計算する。

実験結果

リサーチクエスチョン

  • RQ1利得スコアベースのサンプリングは、CP テンソル分解における最小二乗部分問題に効果的に適用可能であり、計算コストの低減を実現できるか?
  • RQ2テンソル分解の文脈において、高確率で ϵ-精度の解を得るために必要なサンプリング複雑度は何か?
  • RQ3性能の劣化を招かずに、ランダムスケッチフレームワーク内で高利得スコアの行を効率的に処理する方法は何か?
  • RQ4提案手法は、大規模スパーステンソルにおいて、決定的 CP-ALS と比較して顕著な高速化を達成できるか、かつ解の品質を維持できるか?
  • RQ5初期化戦略の選択が、ランダム化アルゴリズムの収束性とフィットネスに与える影響は何か?

主な発見

  • 本手法は、(d+1)-ウェイテンソルに対して、テンソルサイズや非ゼロ要素数に依存しない O(rd/ϵ) のサンプリング複雑度を達成し、高確率での精度保証を有する。
  • Enron テンソル(5420万非ゼロ、4ウェイ)において、RRF 初期化を用いた CP-ARLS-LEV は、s=2^18 のサンプル数で、CP-ALS よりも中央値で 5.78 倍高速であった。
  • Uber テンソル(330万非ゼロ)において、s=2^19 のサンプル数で、CP-ARLS-LEV の中央値実行時間は CP-ALS よりも 4.39 倍高速であった。
  • 初期残差 (X⊥) を低減し、ガウス初期化と比較してフィットネスを最大 30% 向上させるために、ランダム化範囲探索(RRF)を初期化に用いることで効果を発揮した。
  • 高利得スコアの行を決定的に含め、他の行を確率的にサンプリングするハイブリッドサンプリング戦略は、純粋なランダムサンプリングと比較して安定性と性能が向上した。
  • 本手法は、決定的 CP-ALS と同等の解の精度を維持しながら、実世界の大規模スパーステンソルにおいて顕著な高速化を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。