Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Bayesian Non-Negative Tensor Factorization for Massive Count Data

Changwei Hu, Piyush Rai|arXiv (Cornell University)|Aug 18, 2015
Tensor decomposition and applications参考文献 21被引用数 13
ひとこと要約

本稿では、マスなカウント値をとるテンソルに対してスケーラブルなベイジアン非負テンソル因子分解モデルを提案する。このモデルはベータ負二項分布の生成モデルを用い、ポアソン分布の再パrameterizationを多項分布として行い、共役性を達成し、効率的なギブスサンプリングと変分ベイズ推論を可能にする。この手法により、テンソルのランクを自動で推定でき、解釈可能なトピックのような要因を提供する。オンライン推論により、従来のバッチ手法では処理できないほどの大規模なテンソルにもスケーラブルに対応できる。

ABSTRACT

We present a Bayesian non-negative tensor factorization model for count-valued tensor data, and develop scalable inference algorithms (both batch and online) for dealing with massive tensors. Our generative model can handle overdispersed counts as well as infer the rank of the decomposition. Moreover, leveraging a reparameterization of the Poisson distribution as a multinomial facilitates conjugacy in the model and enables simple and efficient Gibbs sampling and variational Bayes (VB) inference updates, with a computational cost that only depends on the number of nonzeros in the tensor. The model also provides a nice interpretability for the factors; in our model, each factor corresponds to a "topic". We develop a set of online inference algorithms that allow further scaling up the model to massive tensors, for which batch inference methods may be infeasible. We apply our framework on diverse real-world applications, such as \emph{multiway} topic modeling on a scientific publications database, analyzing a political science data set, and analyzing a massive household transactions data set.

研究の動機と目的

  • マスなスパースで過分散を示すカウント値をとるテンソルデータに適した完全ベイジアン非負テンソル因子分解モデルの開発。
  • 分解のランクを事前に指定することなく、自動的にランクを推定可能にする。
  • テンソルモードのオブジェクト上での分布(トピック)を表す解釈可能な潜在的要因を提供する。
  • 従来の手法では処理できないほどの大規模なテンソルに適した、バッチおよびオンライン推論アルゴリズムの設計。
  • マルチウェイトピックモデリング、政治科学分析、大規模消費者取引モデリングといった実世界の応用を支援する。

提案手法

  • 過分散を示すカウントデータを捉え、共役性を実現するため、ベータ負二項分布の生成モデルを用いる。
  • ポアソン尤度を多項分布として再定式化することで共役性を達成し、閉形式のギブスサンプリングと変分ベイズ更新を可能にする。
  • 各因子行列の列にディリクレ事前分布を適用し、各因子がテンソルモードのオブジェクト上での分布(トピック)を表すように保証する。
  • テンソル要素をポアソン分布の混合としてモデル化するため、ガンマ-ガンマ-ポアソンの階層構造を採用する。
  • 2種類のオンライン推論アルゴリズムを開発する:オンラインMCMCと確率的変分ベイズ推論。両者とも計算コストが非ゼロ要素数に比例する。
  • 条件付き密度フィルタリングと適応的学習率を用いた確率的変分ベイズ推論により、マスなテンソルへのスケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアン非負テンソル因子分解モデルは、マスでスパースかつ過分散を示すカウント値をとるテンソルデータを効果的に処理できるか?
  • RQ2ポアソン因子分解のような非共役モデルにおいて、効率的なギブスサンプリングと変分ベイズ推論を可能にするために、共役性をどのように達成できるか?
  • RQ3モデルは、分解のランクを手動で指定することなく、真のランクを自動で推定できるか?
  • RQ4オンライン推論アルゴリズムは、マスなテンソルにおいて、バッチ手法と比較して収束速度とスケーラビリティの点で優れているか?
  • RQ5推定された因子は、実世界の応用において意味のあるトピックやテンソルモード上の分布として解釈可能か、どの程度まで解釈可能か?

主な発見

  • 提案手法は、117,054×438×67,095の家計取引データセットのようなマスなテンソルを効果的に処理でき、PTF や lraNTD といった最先端手法がストレージと計算制約により失敗する状況でも動作する。
  • オンライン推論手法(条件付き密度フィルタリングと確率的変分ベイズ推論)は、同じマスな取引データにおいて、バッチ手法よりも著しく高速に収束し、より短い時間でより高いホールドアウト尤度を達成する。
  • バッチ推論においても、同様のデータを処理するPTFベースラインと比較して、著しく高速であり、1イテレーションあたりの実行時間が大幅に短縮されている。
  • 推定された因子は解釈可能である。例えば、取引データでは、3つの明確な消費者行動クラスタが出現した—人気のある店、卸売店、品揃えが少ない店—それぞれが異なる商品嗜好と行動パターンを示した。
  • モデルは、消費者の買い物行動における行動の硬直性を明らかにした。家計は特定の店に強く偏り、利用可能な食品品目のわずか一部しか購入しない傾向にあり、探索行動が限定的であることが示唆された。
  • 推定されたλパラメータは、100個の因子のうち約60個が有意であることを示しており、モデルが分解の有効ランクを自動で推定できることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。