Skip to main content
QUICK REVIEW

[論文レビュー] Recommendation from Raw Data with Adaptive Compound Poisson Factorization

Olivier Gouvert, Thomas Oberlin|Open Archive Toulouse Archive Ouverte (University of Toulouse)|May 20, 2019
Recommender Systems and Techniques参考文献 40被引用数 9
ひとこと要約

本稿では、化合物ポアソン構造による自己励起を活用することで、レコメンデーションシステムにおける生カウントデータを統合的にモデル化する、適応的複合ポアソン因子分解(dcPF)を提案する。生データおよびバイナリ化データの両方において、ポアソン因子分解(PF)を自然に一般化することで、スケーラブルな推論と過分散への強い適応性を備えた、最先端の推薦性能を達成する。

ABSTRACT

Count data are often used in recommender systems: they are widespread (song play counts, product purchases, clicks on web pages) and can reveal user preference without any explicit rating from the user. Such data are known to be sparse, over-dispersed and bursty, which makes their direct use in recommender systems challenging, often leading to pre-processing steps such as binarization. The aim of this paper is to build recommender systems from these raw data, by means of the recently proposed compound Poisson Factorization (cPF). The paper contributions are three-fold: we present a unified framework for discrete data (dcPF), leading to an adaptive and scalable algorithm; we show that our framework achieves a trade-off between Poisson Factorization (PF) applied to raw and binarized data; we study four specific instances that are relevant to recommendation and exhibit new links with combinatorics. Experiments with three different datasets show that dcPF is able to effectively adjust to over-dispersion, leading to better recommendation scores when compared with PF on either raw or binarized data.

研究の動機と目的

  • バイナリ化などの事前処理を施さずに、過分散かつバースト性を示すカウントデータをレコメンデーションシステムでモデル化する課題に対処すること。
  • 生データおよびバイナリ化データの両方においてポアソン因子分解(PF)を一般化する、離散的複合ポアソン因子分解(dcPF)の統合的フレームワークを構築すること。
  • 閉形式の事後更新と柔軟な要素分布による過分散への適応的モデリングを通じて、スケーラブルな推論を可能にすること。
  • スターリング数の第3種(ラハ数)を介して、dcPFと組合せ論の間の理論的および実証的関係を確立すること。

提案手法

  • 観測されたカウントが、潜在的なセッション数とアイテム固有の自己励起を伴う複合ポアソン過程によって生成される階層的モデルとしてdcPFを定式化する。
  • 過分散を制御するパラメータθを有する指数分散(ED)分布を要素分布として用い、ユーザー行動のバースト性をモデル化する。
  • 複合ポアソン構造の共役性とスケーラビリティを活用して、潜在的要因WおよびHの閉形式事後更新を導出する。
  • 高分散カウントデータのモデリングを改善するために、新しいシフトされたネガティブバイノミアル分布を要素分布として導入する。
  • スパースで過分散なデータを扱うために、適応的パrameterizationを用いた変分推論を実世界のデータセットに適用する。
  • dcPFがθ → θ_rawの極限で生データにおけるPFに、θ → θ_binの極限でバイナリ化データにおけるPFにそれぞれ収束することを示す。

実験結果

リサーチクエスチョン

  • RQ1統合的要因分解フレームワークは、スケーラビリティと過分散への適応性を保ちながら、レコメンデーションシステムにおける生カウントデータを効果的にモデル化できるか?
  • RQ2dcPFは生データおよびバイナリ化データに適用されたポアソン因子分解をどのように一般化するのか?その一般化の理論的極限は何か?
  • RQ3要素分布はバースト性および過分散を示すユーザー行動をどのように捉えているのか?また、スターリング数の第3種(ラハ数)のような組合せ構造とどのような関係があるのか?
  • RQ4シフトされたネガティブバイノミアルのような新しい要素分布は、標準的な選択肢と比較して、高分散カウントデータのモデリング性能を向上させられるか?
  • RQ5dcPFは、推薦精度およびデータ分散への適応性という観点から、従来のPFよりも生データまたはバイナリ化データにおいてどれほど優れているのか?

主な発見

  • dcPFは、Taste Profile、NIPS、Last.fmの3つの実世界データセットにおいて、生データおよびバイナリ化データの両方でPFを上回る推薦性能を達成し、平均逆順位(MRR)で最大10%の向上を示した。
  • モデルの自然パラメータθ(log(p))は、非ゼロカウントの分散対平均比と強く相関しており、過分散への適応性を示している(例:Last.fmで17.0)。
  • dcPFがθ → θ_raw(ここでκᵀψ(θ) → -∞)の極限で生データにおけるPFに収束し、θ → θ_bin(ここでκᵀψ(θ) → +∞)の極限でバイナリ化データにおけるPFに収束することを数学的に証明した。
  • シフトされたネガティブバイノミアル分布を要素分布として用いることで、高分散データのモデリングが改善され、3つのデータセットにおける学習済みp値はそれぞれ0.87、0.86、0.90であった。
  • フレームワークは組合せ論への新しい関係を明らかにした。モデルの正規化定数が、要素の順序付き分割を数えるスターリング数の第3種(ラハ数)に関連していることが示された。
  • 閉形式の更新と非ゼロエントリのみへの依存性により、推論アルゴリズムはスケーラブルであり、従来のPF手法の効率性を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。