Skip to main content
QUICK REVIEW

[论文解读] A Probabilistic Framework for Location Inference from Social Media

Yujie Qian, Jie Tang|arXiv (Cornell University)|Feb 23, 2017
Human Mobility and Location-Based Analysis参考文献 43被引用 13
一句话总结

该论文提出了一种半监督因子图模型(SSFGM),通过整合内容、社交网络和深度神经网络嵌入,从社交媒体中推断用户位置。利用一种新颖的双链采样(TCS)算法,该方法在保持高准确率的同时,相比传统环状信念传播(LBP)实现了超过100倍的速度提升,适用于Twitter和Weibo数据集。

ABSTRACT

We study the extent to which we can infer users' geographical locations from social media. Location inference from social media can benefit many applications, such as disaster management, targeted advertising, and news content tailoring. The challenges, however, lie in the limited amount of labeled data and the large scale of social networks. In this paper, we formalize the problem of inferring location from social media into a semi-supervised factor graph model (SSFGM). The model provides a probabilistic framework in which various sources of information (e.g., content and social network) can be combined together. We design a two-layer neural network to learn feature representations, and incorporate the learned latent features into SSFGM. To deal with the large-scale problem, we propose a Two-Chain Sampling (TCS) algorithm to learn SSFGM. The algorithm achieves a good trade-off between accuracy and efficiency. Experiments on Twitter and Weibo show that the proposed TCS algorithm for SSFGM can substantially improve the inference accuracy over several state-of-the-art methods. More importantly, TCS achieves over 100x speedup comparing with traditional propagation-based methods (e.g., loopy belief propagation).

研究动机与目标

  • 解决在社交媒体中仅使用少量标注数据时推断用户地理位置的挑战。
  • 克服在大规模社交网络中位置推断计算成本过高的可扩展性问题。
  • 开发一种灵活且可泛化的模型,整合多种信息源——内容、网络结构和学习得到的深度特征。
  • 实现有效的半监督学习,以利用少量标注数据和大量未标注数据。
  • 设计一种适用于百万节点级社交网络的高效推理算法,且不牺牲准确性。

提出的方法

  • 将位置推断形式化为一种结合内容、社交网络和潜在特征表示的半监督因子图模型(SSFGM)。
  • 训练一个两层神经网络,从用户内容和网络结构中学习深度的低维表示。
  • 将学习到的潜在特征作为额外的势函数引入SSFGM,以提升建模精度。
  • 提出双链采样(TCS)算法,一种新颖的推理方法,通过使用两条并行马尔可夫链高效近似后验分布。
  • 设计TCS算法以支持并行化和可扩展性,通过减少对完整图传播的依赖,实现在大规模网络上的快速推理。
  • 采用基于采样的推理方法,避免传统方法(如环状信念传播,LBP)带来的高计算成本。

实验结果

研究问题

  • RQ1如何有效结合内容、社交网络结构和学习到的深度特征以实现用户位置推断?
  • RQ2当仅有少量用户具有标注位置时,半监督概率模型是否能提升准确性?
  • RQ3如何在不牺牲准确性的前提下,将位置推断扩展到百万节点级社交网络?
  • RQ4内容、个人资料和网络特征对位置预测性能的相对贡献是什么?
  • RQ5基于采样的推理算法是否能同时实现高准确率和相比传统传播方法数量级的速度提升?

主要发现

  • 双链采样(TCS)算法相比环状信念传播(LBP)实现了超过100倍的速度提升,在小规模数据集上将训练时间从16.8分钟缩短至9秒以内。
  • 在大规模Twitter和Weibo数据集上,TCS训练的SSFGM实现了最先进水平的准确率,优于现有方法(包括GCN和LBP)。
  • 基于内容的特征对位置预测的贡献最大,当其被移除时准确率下降12.5%,其次是网络特征和资料特征。
  • 即使仅使用10%的标注数据,该模型仍保持强劲性能,且随着训练数据增加,准确率持续提升,而基线逻辑回归模型则表现平平。
  • 在单张GPU上,TCS在百万规模数据集上的训练时间仅为1–2小时,而GCN超过11小时,展现出卓越的可扩展性。
  • SSFGM结合TCS在小规模Facebook数据集上达到91.23%的准确率,与LBP性能相当,但速度提升了118倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。