Skip to main content
QUICK REVIEW

[論文レビュー] Discriminative Nonparametric Latent Feature Relational Models with Data Augmentation

Bei Chen, Ning Chen|arXiv (Cornell University)|Dec 7, 2015
Bayesian Methods and Mixture Models参考文献 32被引用数 3
ひとこと要約

本稿では、データ拡張とギブスサンプリングを用いることで、未知の潜在的特徴次元数を有する大規模ネットワークにおけるスケーラブルでエンドツーエンドのリンク予測を可能にする、判別的非パrametric潜在特徴関係モデル(DLFRM)を提案する。正則化されたベイズ推論をロジスティック損失およびハードマージン損失の両方と統合することにより、クラスの不均衡に対処し、最大数十万のエンティティおよび数百万のリンクを有する実世界のネットワークで最先端の性能を達成する。

ABSTRACT

We present a discriminative nonparametric latent feature relational model (LFRM) for link prediction to automatically infer the dimensionality of latent features. Under the generic RegBayes (regularized Bayesian inference) framework, we handily incorporate the prediction loss with probabilistic inference of a Bayesian model; set distinct regularization parameters for different types of links to handle the imbalance issue in real networks; and unify the analysis of both the smooth logistic log-loss and the piecewise linear hinge loss. For the nonconjugate posterior inference, we present a simple Gibbs sampler via data augmentation, without making restricting assumptions as done in variational methods. We further develop an approximate sampler using stochastic gradient Langevin dynamics to handle large networks with hundreds of thousands of entities and millions of links, orders of magnitude larger than what existing LFRM models can process. Extensive studies on various real networks show promising performance.

研究の動機と目的

  • モデル選択や固定されたKに依存せずに、リンク予測における未知の潜在的特徴次元数の課題に対処する。
  • 正のリンクと負のリンクに別々の正則化パラメータを割り当てることで、実世界のネットワークにおけるクラスの不均衡を扱う。
  • 滑らかでないハードマージン損失と滑らかなロジスティック損失の両方の分析を、一つの正則化されたベイズ推論フレームワーク内で統一する。
  • 変分法の制限的な仮定を避けるために、データ拡張を用いた効率的なギブスサンプラーを開発する。
  • ストークスティック・グラディエント・ランジュヴィアン・ダイナミクス(SGLD)を用いて、10万以上のエンティティおよび100万以上のリンクを有する大規模ネットワークへのスケーリングを実現する。

提案手法

  • 予測損失と事後確率推論を組み合わせるため、RegBayesフレームワークを用いて判別的ベイズモデルとしてリンク予測を定式化する。
  • 非共役な事後確率推論を条件付き共役な形に変換するためにデータ拡張を適用し、単純なギブスサンプリングを可能にする。
  • 潜在的特徴の非パラメトリックな事前分布としてインディアン・バーベッジ過程(IBP)を用い、特徴次元数の自動発見を可能にする。
  • 正のリンクと負のリンクにそれぞれ別々の正則化パラメータ $c^+$ と $c^-$ を組み込み、データの不均衡を緩和する。
  • SGLDを用いたストークスティックな近似ギブスサンプラーを開発し、10万以上のエンティティおよび100万以上のリンクを有するネットワークへのスケーリングを実現する。
  • 正則化推論を通じて、ロジスティック損失とハードマージン損失の両方を同じフレームワーク内で統一的に扱う。

実験結果

リサーチクエスチョン

  • RQ1非パラメトリックな潜在的特徴モデルは、事前に指定された数なしに、正しい潜在的特徴数を自動的に推定できるか?
  • RQ2実世界のネットワークにおけるクラスの不均衡は、リンク予測の潜在的特徴モデルでどのように効果的に処理できるか?
  • RQ3滑らかでない(ハードマージン)損失関数と滑らかな(ロジスティック)損失関数を、同一の推論フレームワーク内で統一できるか?
  • RQ4データ拡張により、制限的な平均場仮定や切断仮定なしに、効率的かつ非切断のギブスサンプリングが可能か?
  • RQ5提案手法は、最大10万のエンティティおよび100万以上のリンクを有する大規模ネットワークにスケーリング可能か?

主な発見

  • データ拡張とギブスサンプリングを用いた提案手法DLFRMは、速やかで安定した収束を示し、150ステップ程度のバーニング段階でテストAUCが安定する。
  • 正則化パラメータ $c^+ / c^-$ を10に設定すると、等しい正則化よりも不均衡ネットワークにおけるAUCが著しく向上し、不均衡の効果的処理が示された。
  • モデルは安定した潜在的特徴数を自動的に学習し、独立した実行間で分散が低く、初期値に強く依存しないという、ロバスト性を示した。
  • ストークスティックなバージョン(stoDLFRM l)は、すべてのデータセットで最高のAUC性能を達成し、近接度に基づく手法や他のLFRMをすべて上回った。
  • 対角行列バージョン(diagDLFRM l)は、特徴次元数Kに対して線形スケーリングが可能であるため、著しく短い訓練時間で競争力のある性能を達成した。
  • 本手法は、最大10万のエンティティおよび100万以上のリンクを有するネットワークにスケーリング可能であり、従来のLFRMモデルが扱える範囲よりも数個のオーダー大きい規模である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。