Skip to main content
QUICK REVIEW

[论文解读] Learning user-specific latent influence and susceptibility from information cascades

Yongqing Wang, Huawei Shen|arXiv (Cornell University)|Oct 15, 2013
Complex Network Analysis Techniques参考文献 23被引用 4
一句话总结

本文提出了一种潜在影响与易感性(LIS)模型,通过两个低维向量表示每个用户——分别捕捉其传播信息的影响力与对信息的易感性,从而以更少的参数实现对级联传播动态的精准预测。通过将传播建模为邻居影响力与用户易感性的乘积,该方法减少了过拟合,并在真实微博客数据上对转发行为、级联规模和传播动态的预测中优于成对模型。

ABSTRACT

Predicting cascade dynamics has important implications for understanding information propagation and launching viral marketing. Previous works mainly adopt a pair-wise manner, modeling the propagation probability between pairs of users using n^2 independent parameters for n users. Consequently, these models suffer from severe overfitting problem, specially for pairs of users without direct interactions, limiting their prediction accuracy. Here we propose to model the cascade dynamics by learning two low-dimensional user-specific vectors from observed cascades, capturing their influence and susceptibility respectively. This model requires much less parameters and thus could combat overfitting problem. Moreover, this model could naturally model context-dependent factors like cumulative effect in information propagation. Extensive experiments on synthetic dataset and a large-scale microblogging dataset demonstrate that this model outperforms the existing pair-wise models at predicting cascade dynamics, cascade size, and "who will be retweeted".

研究动机与目标

  • 为解决现有成对模型中因独立处理所有用户对而产生的严重过拟合问题,尤其是对未观测到的互动关系。
  • 使用低维潜在向量而非 $n^2$ 个成对参数,对用户特定的影响力与易感性进行建模。
  • 自然地捕捉上下文依赖效应,如信息传播中的累积暴露。
  • 在无需显式社交网络结构的前提下,实现对级联动态、规模及转发行为的精准预测。
  • 提供人际影响力在信息传播中主题感知的定量理解。

提出的方法

  • 每个用户由两个非负的 $d$-维潜在向量表示:影响力向量 $I_u$ 和易感性向量 $S_u$,用于建模其在 $d$ 个潜在主题上扩散和接收信息的倾向。
  • 从用户 $v$ 到 $u$ 的传播概率建模为内积 $I_v^T S_u$,捕捉邻居影响力与目标易感性之间的交互作用。
  • 模型使用最大似然估计基于观测到的信息级联训练潜在向量,通过优化观测转发序列的对数似然函数进行学习。
  • 该方法适用于显式与隐式社交网络,因其从级联记录中学习,而不依赖预定义的网络结构。
  • 通过话题分布与 Kendall-$\tau$ 相关系数分析潜在特征中的主题分配,验证所学向量的区分性与主题特异性。
  • 通过允许对同一消息的先前暴露增加用户的易感性,模型整合了累积效应,融合了级联模型与阈值模型的行为特征。

实验结果

研究问题

  • RQ1低秩的用户特定影响力与易感性表示是否能在预测信息级联动态方面优于成对模型?
  • RQ2潜在向量在多大程度上能捕捉上下文依赖的传播效应,如对同一消息的累积暴露?
  • RQ3所学习的影响力与易感性向量在多大程度上反映了现实社交媒体中主题特定的人际影响力?
  • RQ4LIS模型在缺乏显式社交网络结构的场景下是否具有良好的泛化能力?
  • RQ5潜在特征与现实世界主题的相关性如何?它们在不同主题间是否具有区分性?

主要发现

  • LIS模型在预测级联动态方面显著优于现有成对模型,所有评估指标下均在归一化折损累计增益(NDCG)与平均倒数排名(MRR)上取得提升。
  • 在新浪微博数据集上,LIS在 T3 时达到 MRR 0.797,超越所有基线模型,并在不同级联规模与时间窗口下保持高性能。
  • 所学习的影响力与易感性向量表现出强烈的主题区分性,潜在特征中的顶级话题标签与相关特征(如 'Xiaomi release')显示出高度相关性(例如,Kendall-$\tau$ = 0.93)。
  • 大多数潜在特征对之间的相关性较低(接近 0),表明模型学习到了独立且主题特定的影响力与易感性表示。
  • 该模型有效捕捉了累积效应:对同一消息的重复暴露会提高用户转发的可能性,从而提升预测准确性。
  • LIS模型在隐式网络中具有良好的泛化能力,因其无需事先了解社交结构,适用于多样化的现实应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。