[论文解读] Interactions in information spread: quantification and interpretation using stochastic block models
本文提出交互式混合成员随机块模型(IMMSBM),一种概率框架,用于量化信息传播和结果预测中实体(如话题标签、症状或产品)之间的成对交互作用。通过建模实体组合对结果的影响,而不仅依赖于单个实体的传播性,该方法在相对概率变化方面相比非交互模型将预测性能提升了高达150%,表明交互作用在社交网络、医学诊断和推荐系统中的准确推断中至关重要。
In most real-world applications, it is seldom the case that a given observable evolves independently of its environment. In social networks, users' behavior results from the people they interact with, news in their feed, or trending topics. In natural language, the meaning of phrases emerges from the combination of words. In general medicine, a diagnosis is established on the basis of the interaction of symptoms. Here, we propose a new model, the Interactive Mixed Membership Stochastic Block Model (IMMSBM), which investigates the role of interactions between entities (hashtags, words, memes, etc.) and quantifies their importance within the aforementioned corpora. We find that interactions play an important role in those corpora. In inference tasks, taking them into account leads to average relative changes with respect to non-interactive models of up to 150\% in the probability of an outcome. Furthermore, their role greatly improves the predictive power of the model. Our findings suggest that neglecting interactions when modeling real-world phenomena might lead to incorrect conclusions being drawn.
研究动机与目标
- 为信息扩散和结果预测中实体(如话题标签、症状、产品)之间的交互建模提供填补空白。
- 量化成对交互作用对结果概率的贡献,超越单个实体的传播性。
- 开发一种可扩展且可解释的模型,以提升真实数据集(如社交媒体、医学语料库和音乐平台)中的预测性能。
- 为解释特定实体组合如何以及为何导致特定结果提供一个框架,从而提升社会科学和人工智能应用中的模型可解释性。
提出的方法
- IMMSBM通过在实体聚类之间引入双线性交互项,扩展了混合成员随机块模型(MMSBM),以建模两组聚类如何共同影响结果概率。
- 该模型采用生成过程,其中每个结果由两个实体的聚类隶属关系的交互决定,由矩阵 $ V_{k,l} $ 参数化,用于捕捉聚类 $ k $ 与 $ l $ 之间交互的强度。
- 开发了一种高效的期望最大化(EM)算法以估计模型参数,从而实现对大规模数据集的可扩展性。
- 该模型区分了单个实体的内在传播性与它们交互带来的额外效应,从而实现对各成分的解耦量化。
- 通过混合成员方法推断聚类隶属关系,其中每个实体以不同概率属于多个聚类,从而实现对复杂语义关系的灵活表示。
- 通过基于聚类组成的手动标注,以及分析交互热力图和隶属度熵,增强了模型的可解释性,以评估聚类的一致性和交互模式。

实验结果
研究问题
- RQ1话题标签、症状或产品等实体之间的成对交互作用在信息传播中如何影响结果的概率?
- RQ2与仅考虑单个实体传播性的模型相比,交互作用在多大程度上提升了预测性能?
- RQ3在真实语料库中,哪些特定的实体聚类对表现出最强或最具意义的交互作用?
- RQ4如何量化和可视化交互效应,以增强模型的可解释性和可说明性?
- RQ5聚类隶属度熵在评估推断出的交互结构的一致性和可解释性方面起到什么作用?
主要发现
- 将成对交互作用纳入模型后,与非交互模型相比,结果预测概率的平均相对提升高达150%。
- 该模型在多种语料库中显著提升了预测性能,包括PubMed(疾病症状)、Reddit(用户讨论)、Twitter(话题标签)和Spotify(音乐播放列表)。
- 交互矩阵 $ V_{k,l} $ 显示,仅一小部分聚类存在有意义的交互,大多数聚类未表现出显著的交互效应。
- 矩阵 $ V_{k,l} $ 的对角线元素始终较低,表明自交互(同一聚类对)的贡献几乎仅来自个体传播性,而跨聚类交互通常会降低或重新定向结果概率。
- 所有语料库中的隶属度熵均较低(0.320–0.561),表明实体主要被分配到一个或两个聚类中,从而增强了可解释性,并支持对聚类进行有意义的手动标注。
- 该模型表明,忽略交互作用会导致错误结论,因为交互作用可能极大地改变结果概率——例如,将“耳痛”与“言语障碍”组合后,诊断结果会从耳部疾病转向脑部疾病。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。