Skip to main content
QUICK REVIEW

[論文レビュー] Fast, Accurate, and Scalable Method for Sparse Coupled Matrix-Tensor Factorization

Dongjin Choi, Jun-Gi Jang|arXiv (Cornell University)|Aug 29, 2017
Tensor decomposition and applications参考文献 22被引用数 6
ひとこと要約

本稿では、ロックフリー並列確率的勾配降下法(SGD)と中間データ再利用を用いた、スパースな結合行列・テンソル因子分解の高速で正確かつスケーラブルな手法 $S^{3}$ CMTF を提案する。実世界のデータにおいて、既存手法と比較して11–43倍の高速化と2.1–4.1倍の低い誤差を達成しており、データサイズおよびコア数に対して線形スケーラビリティを示す。

ABSTRACT

How can we capture the hidden properties from a tensor and a matrix data simultaneously in a fast, accurate, and scalable way? Coupled matrix-tensor factorization (CMTF) is a major tool to extract latent factors from a tensor and matrices at once. Designing an accurate and efficient CMTF method has become more crucial as the size and dimension of real-world data are growing explosively. However, existing methods for CMTF suffer from lack of accuracy, slow running time, and limited scalability. In this paper, we propose S3CMTF, a fast, accurate, and scalable CMTF method. S3CMTF achieves high speed by exploiting the sparsity of real-world tensors, and high accuracy by capturing inter-relations between factors. Also, S3CMTF accomplishes additional speed-up by lock-free parallel SGD update for multi-core shared memory systems. We present two methods, S3CMTF-naive and S3CMTF-opt. S3CMTF-naive is a basic version of S3CMTF, and S3CMTF-opt improves its speed by exploiting intermediate data. We theoretically and empirically show that S3CMTF is the fastest, outperforming existing methods. Experimental results show that S3CMTF is 11~43 times faster, and 2.1~4.1 times more accurate than existing methods. S3CMTF shows linear scalability on the number of data entries and the number of cores. In addition, we apply S3CMTF to Yelp recommendation tensor data coupled with 3 additional matrices to discover interesting properties.

研究の動機と目的

  • スパースな実世界データにおける結合行列・テンソル因子分解(CMTF)の高速で正確かつスケーラブルな手法の不足に対処する。
  • 既存のCMTF手法の限界、すなわち収束が遅い、モデル容量が限られることによる正確性の低さ、および高いメモリ使用量を克服する。
  • スパarsityと要因間の関係を活用することで、テンソルと行列の効率的かつ統合的な因子分解を可能にする。
  • 大規模な実世界データセットに対して、データサイズおよび並列コア数の両方で線形スケーラビリティを達成する。

提案手法

  • 実世界のテンソルにおけるスパarsityを活用することで計算コストを低減する、確率的勾配降下法(SGD)に基づくCMTF手法である $S^{3}$ CMTF を提案する。
  • マルチコア共有メモリ環境での効率的実行を可能にするために、ロックフリー並列SGD更新を実装する。
  • 2つのバージョンを導入する:$S^{3}$ CMTF-naive(基本版)と $S^{3}$ CMTF-opt(最適化版)、後者は中間計算結果の再利用により性能向上を実現する。
  • ユーザーの友人関係、ビジネスの分類、都市の位置など、結合行列(例)を事前知識として活用し、因子分解の正確性とモデル容量を向上させる。
  • 解釈可能性を向上させるとともに因子行列の非負性を維持するために、射影勾配降下法を用いた非負因子分解を適用する。
  • クラスタリングおよび解釈性分析のベースラインとして、タッカー分解を用いる。

実験結果

リサーチクエスチョン

  • RQ1スパースで高次元の実世界データにおいて、CMTF手法が高い正確性を維持しながら高速な実行時間と線形スケーラビリティを達成できるか?
  • RQ2結合テンソル・行列フレームワークにおける要因間の相互関係を組み込むことで、モデル容量と予測正確性はどのように向上するか?
  • RQ3中間データ再利用を伴うロックフリー並列SGDは、CMTFにおける計算効率をどの程度向上させるか?
  • RQ4$S^{3}$ CMTF は、Yelp のような実世界データセットにおいて、意味のあるクラスタの同定とユーザーの嗜好・時間的・空間的要因に基づくパーソナライズドレコメンデーションを効果的に実現できるか?
  • RQ5時間、正確性、メモリ使用量、並列処理可能性の観点から、$S^{3}$ CMTF は既存のCMTF手法と比べてどのように差をつけるか?

主な発見

  • $S^{3}$ CMTF は、MovieLens、Netflix、Yelp などの実世界データセットにおいて、既存のCMTF手法と比較して11–43倍の高速な学習速度を達成した。
  • 最先端手法と比較して、テストRMSEを2.1–4.1倍低減し、優れた正確性を示した。
  • $S^{3}$ CMTF-opt は収束速度と正確性が最も良く、$S^{3}$ CMTF-naive や他のベースラインと顕著な差を示した。
  • データエントリ数および並列コア数の両方に対して、線形スケーラビリティを示し、大規模な実装に適した性能を発揮した。
  • Yelp データセットにおいて、$S^{3}$ CMTF はタッカー分解を上回るクラスタリング能力を示し、ビジネスエンティティのクラスタリングにおいて高いギャップ統計量を達成した。
  • 本手法は、ユーザー固有の潜在的コンセプト(例:「スパ&ヘルス」と「 grills & restaurants」)を効果的に同定でき、ユーザーのプロファイルおよび時間的・空間的要因に基づくパーソナライズドレコメンデーションを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。