Skip to main content
QUICK REVIEW

[论文解读] A Data-Based Approach to Social Influence Maximization

Amit Goyal, Francesco Bonchi|arXiv (Cornell University)|Sep 30, 2011
Complex Network Analysis Techniques参考文献 6被引用 11
一句话总结

本文提出了一种基于数据的影响最大化模型——信用分配(Credit Distribution, CD),该模型直接从历史传播轨迹中学习,以预测影响传播,而无需学习边概率或进行蒙特卡洛模拟。CD 模型在准确度上最接近真实值,同时相比传统方法快几个数量级且更具可扩展性。

ABSTRACT

Influence maximization is the problem of finding a set of users in a social network, such that by targeting this set, one maximizes the expected spread of influence in the network. Most of the literature on this topic has focused exclusively on the social graph, overlooking historical data, i.e., traces of past action propagations. In this paper, we study influence maximization from a novel data-based perspective. In particular, we introduce a new model, which we call credit distribution, that directly leverages available propagation traces to learn how influence flows in the network and uses this to estimate expected influence spread. Our approach also learns the different levels of influenceability of users, and it is time-aware in the sense that it takes the temporal nature of influence into account. We show that influence maximization under the credit distribution model is NP-hard and that the function that defines expected spread under our model is submodular. Based on these, we develop an approximation algorithm for solving the influence maximization problem that at once enjoys high accuracy compared to the standard approach, while being several orders of magnitude faster and more scalable.

研究动机与目标

  • 解决传统影响最大化方法依赖假设或估计的边概率而非真实传播数据的局限性。
  • 研究不同边概率分配方法与从真实数据中学习的方法在预测影响传播方面的对比。
  • 开发一种可扩展且准确的影响最大化方法,避免昂贵的蒙特卡洛模拟和边概率学习。
  • 评估影响最大化解决方案对学习概率中噪声的鲁棒性,并评估训练数据规模对种子选择质量的影响。

提出的方法

  • 提出信用分配(CD)模型,该模型直接利用历史行为传播轨迹估计影响传播,而无需学习单个边的概率。
  • 使用截断阈值 λ 限制影响传播深度,从而在保持准确度的同时降低计算成本。
  • 采用贪心算法基于 CD 模型的影响传播估计选择种子节点,利用子模性获得近似保证。
  • 通过直接挖掘行为日志计算期望影响传播,避免蒙特卡洛模拟,显著提升可扩展性。
  • 引入时间感知机制,考虑网络中影响传播的时间动态特性。
  • 使用包含数百万条传播元组的真实世界数据集(Flixster、Flickr)进行模型训练与评估。

实验结果

研究问题

  • RQ1依赖假设的边概率分配方法(如恒定值、按入度倒数分配)与从真实数据中学习的方法在预测影响传播方面有何差异?
  • RQ2使用学习到的概率的传统模型(IC、LT)在种子选择和传播预测方面与真实值相比有多大差异?
  • RQ3一种直接从历史传播轨迹中学习的模型是否能优于需要边概率估计和蒙特卡洛模拟的方法?
  • RQ4影响最大化性能对学习概率中噪声的敏感程度如何?解决方案对这些扰动的鲁棒性如何?
  • RQ5实现接近最优种子选择质量所需的最少训练数据量(传播轨迹)是多少?

主要发现

  • 信用分配模型在预测影响传播方面准确度最高,在 Flixster Large 和 Flickr Large 数据集上最接近真实值。
  • 仅使用 100 万条元组,CD 模型在影响传播和种子集质量方面即可达到与使用完整 650 万条元组的 Flixster 数据集相当的水平。
  • 在 Flickr Large 数据集中,影响传播在 800 万条元组后趋于收敛,表明少量样本轨迹已足以实现高质量的种子选择。
  • 当截断阈值 λ = 0.001 时,模型性能达到饱和,进一步提升无显著改善,因此该值是实用且高效的合理选择。
  • 任意分配概率的方法(如恒定值或三值分配)产生的种子集与基于数据驱动方法选择的种子集存在显著差异,导致巨大预测误差。
  • 在 CD 模型下,贪心算法具有高度可扩展性,相比基于蒙特卡洛的方法,运行时间与内存使用显著减少,同时保持高准确度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。