Skip to main content
QUICK REVIEW

[论文解读] Who Will Share My Image? Predicting the Content Diffusion Path in Online Social Networks

Wenjian Hu, Krishna Kumar Singh|arXiv (Cornell University)|May 25, 2017
Complex Network Analysis Techniques参考文献 39被引用 6
一句话总结

本文提出 Diffusion-LSTM,一种基于记忆的循环神经网络,通过联合建模图像内容与动态社交背景,预测图像在在线社交网络中的完整传播路径。通过编码分享者社交特征的历史信息,并利用用户原型实现泛化,该模型在预测真实扩散树方面优于基线模型,生成的扩散树在 Pinterest 数据上的表现与真实路径高度吻合。

ABSTRACT

Content popularity prediction has been extensively studied due to its importance and interest for both users and hosts of social media sites like Facebook, Instagram, Twitter, and Pinterest. However, existing work mainly focuses on modeling popularity using a single metric such as the total number of likes or shares. In this work, we propose Diffusion-LSTM, a memory-based deep recurrent network that learns to recursively predict the entire diffusion path of an image through a social network. By combining user social features and image features, and encoding the diffusion path taken thus far with an explicit memory cell, our model predicts the diffusion path of an image more accurately compared to alternate baselines that either encode only image or social features, or lack memory. By mapping individual users to user prototypes, our model can generalize to new users not seen during training. Finally, we demonstrate our model's capability of generating diffusion trees, and show that the generated trees closely resemble ground-truth trees.

研究动机与目标

  • 建模图像在社交网络中传播的完整路径,而非仅预测总传播热度。
  • 解决不仅预测图像是否传播,还预测由谁传播及传播顺序的挑战。
  • 将图像内容与动态社交背景(即先前分享者的历史)整合到统一的预测框架中。
  • 通过将用户映射到基于社交特征的原型,实现对训练中未见新用户的泛化。
  • 生成结构化的扩散树,使其与社交媒体中观察到的真实传播模式相似。

提出的方法

  • Diffusion-LSTM 使用带有显式记忆单元的长短期记忆(LSTM)架构,编码图像分享者序列的历史信息。
  • 图像特征通过预训练的 VGG-16 网络提取,用户社交特征则表示为 38 维的 Pinterest 类别直方图。
  • 模型通过结合图像特征、当前用户的社会特征以及上一时刻的隐藏状态,递归预测下一步的分享者。
  • 通过基于用户社交特征分布的聚类生成用户原型,从而在推理阶段实现对未见用户的泛化。
  • 通过递归预测 101 个类别(100 个原型 + 终止类别)生成树结构,停止条件设定为终止节点概率达到 0.5。
  • 评估采用截断树(深度 ≤10,大小 ≤150,宽度 ≤100)的深度特定平均绝对误差(MAE),以避免树的退化增长。

实验结果

研究问题

  • RQ1是否能够通过追踪图像分享者历史的深度循环模型,比忽略历史信息的模型更准确地预测图像传播的完整用户序列?
  • RQ2结合图像内容与动态社交背景,相比仅使用单一模态的模型,能否显著提升扩散路径预测的准确性?
  • RQ3用户原型在多大程度上可实现对训练数据中未出现的新用户的泛化?
  • RQ4该模型在多大程度上能生成与真实社交媒体传播模式相似的结构化扩散树?
  • RQ5在确定扩散链中下一个分享者时,图像内容与社交特征的相对贡献如何?

主要发现

  • Diffusion-LSTM 显著优于缺乏记忆机制或仅使用图像或社交特征的基线模型,证明了序列历史建模的重要性。
  • 与全连接(FC)基线相比,该模型生成的扩散树与真实树更为接近,所有树深度下的深度特定 MAE 均有显著改善。
  • 即使在错误预测具体用户时,模型预测的用户也常与真实用户属于同一 Pinterest 类别,表明其在社交特征对齐方面具有鲁棒性。
  • 模型能正确捕捉长距离依赖关系,例如预测出与初始分享者属于同一原型组的用户,证明了记忆机制的有效利用。
  • 当同一原型用户发布不同图像时,生成的扩散树会相应调整——例如园艺类图像会引发更多园艺类用户参与,证实了图像内容的关键作用。
  • 通过原型映射,模型在未见用户上表现出良好的泛化能力,训练与推理阶段在新用户身份上的表现保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。