Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Realistic Recommendation Datasets through Fractal Expansions

Francois Belletti, Karthik Lakshmanan|arXiv (Cornell University)|Jan 23, 2019
Recommender Systems and Techniques参考文献 52被引用数 16
ひとこと要約

本稿では、Kroneckerグラフ理論を用いたフラクタル拡張技術を提案し、小規模な公開データセットから大規模で現実的ないくらの推薦データセットを生成する。この手法により、ユーザーエンゲージメント、アイテム人気、特異値スペクトルといった重要な統計的性質を保持する。本手法により、MovieLens 20Mデータセットを100億レーティング(200万ユーザー、86万4千アイテム)まで拡張し、最大で6550億レーティング(1700万ユーザー、700万アイテム)までスケーリング可能であり、プライバシー上のリスクなしに産業規模のベンチマークが可能となる。

ABSTRACT

Recommender System research suffers currently from a disconnect between the size of academic data sets and the scale of industrial production systems. In order to bridge that gap we propose to generate more massive user/item interaction data sets by expanding pre-existing public data sets. User/item incidence matrices record interactions between users and items on a given platform as a large sparse matrix whose rows correspond to users and whose columns correspond to items. Our technique expands such matrices to larger numbers of rows (users), columns (items) and non zero values (interactions) while preserving key higher order statistical properties. We adapt the Kronecker Graph Theory to user/item incidence matrices and show that the corresponding fractal expansions preserve the fat-tailed distributions of user engagements, item popularity and singular value spectra of user/item interaction matrices. Preserving such properties is key to building large realistic synthetic data sets which in turn can be employed reliably to benchmark Recommender Systems and the systems employed to train them. We provide algorithms to produce such expansions and apply them to the MovieLens 20 million data set comprising 20 million ratings of 27K movies by 138K users. The resulting expanded data set has 10 billion ratings, 864K items and 2 million users in its smaller version and can be scaled up or down. A larger version features 655 billion ratings, 7 million items and 17 million users.

研究の動機と目的

  • 小規模な学術的推薦データセットと産業用生産システムの巨大スケールの間のギャップを埋める。
  • データ拡張中に、ファットテール型のユーザーエンゲージメント、アイテム人気、特異値スペクトルといった重要な高次統計的性質を保持する。
  • 実世界の協調フィルタリングの課題をスケールで再現する、合成的ではあるが現実的なユーザ-アイテム相互作用データを生成する。
  • 産業システムと同等の規模のデータで、行列分解および類似度ベースの推薦モデルの再現可能なベンチマークを可能にする。
  • 保有データを公開する代替手段として、公開済みの小規模データから合成データセットを生成することで、スケーラブルかつプライバシー保護された代替策を提供する。

提案手法

  • ユーザ-アイテムインシデント行列にKroneckerグラフ理論を適用し、自己同様性構造としての相互作用行列をモデル化し、フラクタル拡張に適した構造とする。
  • Kronecker積に基づく拡張を用い、元のスパース行列をユーザーやアイテム、相互作用の各次元でスケーリングしつつ、統計的不変性を保持する。
  • 標準的なKronecker生成プロセスを変更し、スパースで非一様に分布するユーザ-アイテム相互作用に対応させ、行と列の和の現実的スケーリングを保証する。
  • 拡張された行列内のブロックをランダムにシャッフルすることで、人工的なブロック単位の繰り返しを解消し、行列分解における自明な解を防ぐ。
  • 行列分解の難易度に不可欠なスペクトル的性質を保持するため、元の行列の特異値分解(SVD)を基盤として用いる。
  • 再帰的Kronecker積を用いた反復的拡張により、元のデータセットの数個のオーダー以上にスケーリング(例:100億から6550億レーティングまで)を実現する。

実験結果

リサーチクエスチョン

  • RQ1フラクタル拡張技術は、大規模な合成推薦データセットにおいて、ユーザーエンゲージメントとアイテム人気のファットテール型分布を保持できるか?
  • RQ2Kroneckerベースの拡張は、元のユーザ-アイテム相互作用行列の特異値スペクトルをどの程度正確に維持できるか? これにより、行列分解の難易度が同等に保たれるか?
  • RQ3合成データは、順位付けられた行および列の和の加速的減衰といった、現実世界の統計的不規則性をどの程度正確に再現できるか?
  • RQ4拡張されたデータセットは、ユーザープライバシーを損なうことなく、産業規模で線形および非線形の協調フィルタリングモデルを信頼性高くベンチマークするのに使用可能か?
  • RQ5Kroneckerベースの拡張には、レーティングスケールの細分化や行列内の構造的繰り返しといった、どのような限界があるか?

主な発見

  • フラクタル拡張により、MovieLens 20Mデータセットが100億レーティング(200万ユーザー、86万4千アイテム)まで拡張され、最大で6550億レーティング(1700万ユーザー、700万アイテム)までスケーリング可能であり、産業スケールの規模に達している。
  • 拡張されたデータセットは、ユーザーエンゲージメントとアイテム人気のファットテール型分布を保持しており、元のデータの統計的プロファイルと密接に一致している。
  • 拡張された行列の特異値スペクトルは準パワーローの性質を示し、元のデータとよく一致しており、行列分解タスクの難易度が同等に保たれている。
  • 合成データセットは、現実世界のデータパターンを再現する不規則性を示しており、順位付けられた行方向および列方向の和の加速的減衰が顕著に再現されている。
  • レーティングスケールがKronecker乗算により細分化されるが、大多数のレーティングは平均値に近く、極端な値よりも中立的相互作用のリアルさが保たれている。
  • 行列ブロックのランダムシャッフルは、ブロック単位の繰り返し構造を効果的に解消し、Kronecker SVDにおける自明な解を防ぎ、モデルの耐性を高めている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。