Skip to main content
QUICK REVIEW

[论文解读] Social-LLM: Modeling User Behavior at Scale using Language Models and Social Network Data

Julie Jiang, Emilio Ferrara|arXiv (Cornell University)|Dec 31, 2023
Complex Network Analysis Techniques被引用 4
一句话总结

Social-LLM 提出了一种可扩展的、归纳式的用户表征模型,通过结合大型语言模型(LLM)生成的用户内容特征与一阶社交网络交互(例如转发、提及)来实现在多样化计算社会科学任务中的高效用户检测。通过利用社交同质性并仅建模直接边,该方法在7个真实世界数据集上实现了最先进性能,同时支持无需微调的样本外推理。

ABSTRACT

The proliferation of social network data has unlocked unprecedented opportunities for extensive, data-driven exploration of human behavior. The structural intricacies of social networks offer insights into various computational social science issues, particularly concerning social influence and information diffusion. However, modeling large-scale social network data comes with computational challenges. Though large language models make it easier than ever to model textual content, any advanced network representation methods struggle with scalability and efficient deployment to out-of-sample users. In response, we introduce a novel approach tailored for modeling social network data in user detection tasks. This innovative method integrates localized social network interactions with the capabilities of large language models. Operating under the premise of social network homophily, which posits that socially connected users share similarities, our approach is designed to address these challenges. We conduct a thorough evaluation of our method across seven real-world social network datasets, spanning a diverse range of topics and detection tasks, showcasing its applicability to advance research in computational social science.

研究动机与目标

  • 解决图表示学习在大规模社交网络数据中的可扩展性限制。
  • 通过整合 LLM 与社交网络结构,实现归纳式用户检测——适用于样本外用户。
  • 评估不同社交互动类型(例如转发、提及)和边属性(方向性、权重)在用户表征中的有效性。
  • 展示所学嵌入在社交网络分析中用于可视化与可解释性的实用性。
  • 为涵盖政治极化、仇恨言论和账号封禁等多样主题的用户检测任务,建立一种稳健、通用的方法。

提出的方法

  • Social-LLM 通过结合 LLM 嵌入的用户个人资料描述与一阶社交网络边(例如转发、提及)来构建用户表征。
  • 通过假设相连用户在语言和行为上具有相似性,建模社交网络同质性,从而实现有效的表征学习。
  • 该方法采用一种简单但有效的图近似——仅将直接边视为信号——避免了复杂图神经网络的训练,从而支持归纳推理。
  • 当性能提升时,不同边类型被无差别组合(例如将转发与提及合并为一种边类型),且方向性被证明对性能至关重要。
  • 可选择性地添加边权重以反映互动强度,当可用时,也整合用户推文嵌入以提升表征质量。
  • 最终的用户嵌入用于下游分类任务,并通过 t-SNE 可视化以评估聚类能力和可解释性。

实验结果

研究问题

  • RQ1一种仅利用 LLM 和一阶社交网络边的简单、可扩展方法,是否能在用户检测任务中超越最先进模型?
  • RQ2当将不同类型的社交互动(例如转发与提及)整体建模或分别建模时,其对模型性能有何影响?
  • RQ3边的方向性和权重在多大程度上能提升用户表征质量和检测准确率?
  • RQ4Social-LLM 嵌入能否有效可视化有意义的社会结构,如政治极化或账号封禁模式?
  • RQ5该模型在涵盖不同主题和检测任务的多样化数据集上表现如何稳健?

主要发现

  • Social-LLM 在 7 个真实世界社交媒体数据集上均实现了最先进性能,在 6 个数据集中优于仅内容或仅网络的基线模型。
  • 与基线相比,该模型在统计上表现出显著改进,最有利数据集的平均 Macro-F1 提升高达 4.1%。
  • 将转发与提及合并为单一边类型可获得更好性能,表明在检测任务中,不同互动类型之间的差异影响较小。
  • 整合边方向性可一致提升性能,凸显社交网络中信息流动的重要性。
  • 在某些情况下,添加边权重可进一步提升性能,表明互动强度携带有意义的信号。
  • 当可用时,用户推文嵌入可使性能平均提升 4% 的 Macro-F1,凸显整合完整用户内容的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。