[論文レビュー] Learning user-specific latent influence and susceptibility from information cascades
本稿では、各ユーザーを2つの低次元ベクトル(影響力と感受性)で表現する潜在的影響力および感受性(LIS)モデルを提案する。このモデルにより、パラメータ数を削減しつつ、情報拡散のダイナミクスを高精度に予測できる。伝搬確率を近隣の影響力とユーザーの感受性の積としてモデル化することで、過学習を低減し、実世界のマイクロブログデータにおけるリツイート予測、カスケードサイズ、ダイナミクス予測において、ペairwiseモデルを上回る性能を発揮する。
Predicting cascade dynamics has important implications for understanding information propagation and launching viral marketing. Previous works mainly adopt a pair-wise manner, modeling the propagation probability between pairs of users using n^2 independent parameters for n users. Consequently, these models suffer from severe overfitting problem, specially for pairs of users without direct interactions, limiting their prediction accuracy. Here we propose to model the cascade dynamics by learning two low-dimensional user-specific vectors from observed cascades, capturing their influence and susceptibility respectively. This model requires much less parameters and thus could combat overfitting problem. Moreover, this model could naturally model context-dependent factors like cumulative effect in information propagation. Extensive experiments on synthetic dataset and a large-scale microblogging dataset demonstrate that this model outperforms the existing pair-wise models at predicting cascade dynamics, cascade size, and "who will be retweeted".
研究の動機と目的
- すべてのユーザー対を独立に扱う従来のペairwiseモデルが示す深刻な過学習、特に未観測の相互作用に対して是正すること。
- ユーザー固有の影響力と感受性を、$n^2$ 個のペアワイズパラメータではなく、低次元の潜在ベクトルでモデル化すること。
- 情報伝播における蓄積的露出などの文脈依存効果を自然に捉えること。
- 明示的なソーシャルネットワーク構造を必要とせず、カスケードのダイナミクス、サイズ、リツイート行動を高精度に予測できること。
- 情報拡散における人間関係的影響の定量的かつトピックに配慮した理解を提供すること。
提案手法
- 各ユーザーは非負の$d$次元潜在ベクトル(影響力ベクトル$I_u$ と感受性ベクトル$S_u$)で表現され、$d$ 個の潜在トピックにおける情報発信および受信の傾向をモデル化する。
- ユーザー$v$ からユーザー$u$ への伝搬確率は、内積$I_v^T S_u$ としてモデル化され、近隣の影響力とターゲットの感受性の相互作用を捉える。
- 観測された情報カスケードに基づいて最大尤度推定を用い、観測されたフォワーディングシーケンスの対数尤度を最適化することで潜在ベクトルを学習する。
- 本手法は、事前に定義されたネットワーク構造に依存せず、カスケード記録から学習するため、明示的および暗黙のソーシャルネットワークに適用可能である。
- 潜在特徴におけるトピック割り当ては、ハッシュタグ分布とKendall-$\tau$相関を用いて分析され、学習されたベクトルの識別性およびトピック特異性を検証する。
- 繰り返しの露出がユーザーの感受性を高めるように設計されており、蓄積的効果を統合することで、カスケードモデルとスイッチングモデルの両方の特性を組み合わせる。
実験結果
リサーチクエスチョン
- RQ1低ランクのユーザー固有の影響力および感受性表現は、ペairwiseモデルを上回って情報カスケードダイナミクスを予測できるか?
- RQ2潜在ベクトルは、同じメッセージに対する蓄積的露出といった文脈依存伝播効果をどの程度正確に捉えられるか?
- RQ3学習された影響力および感受性ベクトルは、実世界のソーシャルメディアにおけるトピック特異的相互影響をどの程度反映しているか?
- RQ4LISモデルは、明示的なソーシャルネットワーク構造が存在しない状況にも効果的に一般化できるか?
- RQ5潜在特徴は実世界のトピックとどの程度相関を示し、異なるテーマ間で識別的か?
主な発見
- LISモデルは、NDCGとMRRの両方の評価指標において、従来のペアワイズモデルを顕著に上回り、カスケードダイナミクスの予測性能が著しく向上した。
- Sina Weiboデータセットでは、T3におけるMRRが0.797に達し、すべてのベースラインを上回り、カスケードサイズや時間窓にかかわらず高い性能を維持した。
- 学習された影響力および感受性ベクトルは強いトピック識別性を示し、潜在特徴における上位ハッシュタグは、『Xiaomi発表』などの関連特徴において高い相関(例:Kendall-$\tau$ = 0.93)を示した。
- 大多数の潜在特徴ペアは低相関(ほぼ0)を示しており、影響力と感受性の両方の独立的かつトピック特異的な表現が学習されていることが示された。
- 本モデルは蓄積的効果を効果的に捉えており、同じメッセージへの繰り返しの露出がリツイート確率を高め、予測精度を向上させた。
- LISモデルは暗黙のネットワークに対しても良好に一般化され、事前にソーシャル構造を必要としないため、多様な実世界の状況に応用可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。