[论文解读] Estimating Social Influence from Observational Data
本文提出泊松影响因子分解(PIF),通过在概率因子模型中使用潜在变量建模未观测到的混杂因素,从观测网络和行为数据中估计社会影响。PIF在半真实和真实世界Last.fm数据上的准确性和鲁棒性均优于现有方法,揭示了在相关歌曲播放行为中,社会影响的作用比以往认为的要小。
We consider the problem of estimating social influence, the effect that a person's behavior has on the future behavior of their peers. The key challenge is that shared behavior between friends could be equally explained by influence or by two other confounding factors: 1) latent traits that caused people to both become friends and engage in the behavior, and 2) latent preferences for the behavior. This paper addresses the challenges of estimating social influence with three contributions. First, we formalize social influence as a causal effect, one which requires inferences about hypothetical interventions. Second, we develop Poisson Influence Factorization (PIF), a method for estimating social influence from observational data. PIF fits probabilistic factor models to networks and behavior data to infer variables that serve as substitutes for the confounding latent traits. Third, we develop assumptions under which PIF recovers estimates of social influence. We empirically study PIF with semi-synthetic and real data from Last.fm, and conduct a sensitivity analysis. We find that PIF estimates social influence most accurately compared to related methods and remains robust under some violations of its assumptions.
研究动机与目标
- 解决从观测数据中估计社会影响的挑战,其中混杂因素(如共享特质和偏好)可能模仿影响效应。
- 将社会影响形式化为需要反事实推理的因果效应,而非依赖于简单相关性。
- 开发一种即使关键混杂因素(如共享兴趣或偏好)未被观测到时也能估计影响的方法。
- 使用半真实数据和真实世界Last.fm数据对方法进行实证评估,以衡量其准确性和鲁棒性。
- 证明标准方法常因未考虑混杂因素而高估社会影响。
提出的方法
- 使用反事实干预形式化社会影响:'如果我们干预改变朋友过去的行为,其同伴的行为会如何变化?'
- 开发PIF,一种联合概率模型,通过泊松因子分解对用户行为(如歌曲播放)和网络结构(如友谊关系)进行建模。
- 使用潜在变量——用户级和项目级因子——作为影响网络关系和行为的未观测混杂因素的代理。
- 利用估计的潜在变量进行因果调整,以减少混杂因素在影响估计中的偏差。
- 使用变分推断训练模型,以近似潜在因子的后验分布,从而实现可扩展的推理。
- 通过保留数据的预测似然性和未来行为的AUC评估模型性能,使用真实Last.fm数据和半真实模拟。
实验结果
研究问题
- RQ1当同质性(homophily)和共享偏好等混杂因素未被观测时,社会影响在多大程度上能从观测数据中可靠估计?
- RQ2PIF在社会影响估计上与基线方法(如未调整的相关性、仅网络模型和多阶段泊松因子分解)相比表现如何?
- RQ3PIF在现实数据设置中对模型假设的违反有多鲁棒?
- RQ4朋友间观察到的行为相关性中有多少可归因于社会影响,又有多少可归因于共享偏好或特质?
- RQ5PIF是否比其他方法在保留数据上泛化得更好,表明其捕捉到了行为传播的真实因果过程?
主要发现
- 在Last.fm数据上,PIF在保留数据上的泊松对数似然(-186)和AUC(0.67)均达到最高,优于所有基线方法,包括未调整、mSPF和仅网络方法。
- PIF估计的平均影响(0.0006)比未调整方法(0.004)小近一个数量级,表明大多数观察到的相关性源于混杂因素而非影响。
- 在半真实实验中,PIF在恢复真实影响值方面优于相关方法,尤其在高混杂条件下表现更优。
- 敏感性分析显示,PIF对部分模型假设的违反保持鲁棒,表明其在现实场景中具有实际应用价值。
- 在真实Last.fm数据中,PIF揭示尽管朋友的播放行为存在相关性,但其大部分相关性由共享偏好驱动,而非直接社会影响。
- 基线模型(基于过去播放频率预测)的保留对数似然为-317.8,PIF显著改善了该结果,表明其具有更强的预测能力和因果保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。