[论文解读] Leveraging Social Foci for Information Seeking in Social Media
本文提出了一套框架,利用社交焦点——即从网络数据和内容数据中推导出的共享兴趣与从属关系——来识别社交媒体平台(如Twitter)上主观性、个人化问题的合适回答者。通过整合社交网络结构与用户生成内容,该方法在各类问题类别中均优于基线模型,针对“建议”类问题的MAP@5达到4.68%,并在不同网络与内容信息比例下均保持强劲表现(MAP > 3%)。
The rise of social media provides a great opportunity for people to reach out to their social connections to satisfy their information needs. However, generic social media platforms are not explicitly designed to assist information seeking of users. In this paper, we propose a novel framework to identify the social connections of a user able to satisfy his information needs. The information need of a social media user is subjective and personal, and we investigate the utility of his social context to identify people able to satisfy it. We present questions users post on Twitter as instances of information seeking activities in social media. We infer soft community memberships of the asker and his social connections by integrating network and content information. Drawing concepts from the social foci theory, we identify answerers who share communities with the asker w.r.t. the question. Our experiments demonstrate that the framework is effective in identifying answerers to social media questions.
研究动机与目标
- 为解决在传统问答平台不适用于此类互动的社交媒体中,识别主观性、个人化问题相关回答者所面临的挑战。
- 探究如何利用社交背景——特别是共享兴趣与从属关系——来提升社交媒体问题的回答者识别效果。
- 开发一个整合网络与内容信息的框架,以建模软性社群成员身份,并推断提问者与潜在回答者之间的共享焦点。
- 在不同问题类别及网络与内容数据比例变化的情况下,评估该框架的有效性。
- 证明基于社交焦点的方法在识别Twitter上主观性问题回答者方面优于基线方法。
提出的方法
- 通过结合网络结构(社交图谱)与用户帖子中的文本内容,推断用户的软性社群成员身份。
- 应用社交焦点理论,对提问者与其社交关系之间的共享兴趣(如体育、音乐、学术等)进行建模。
- 采用带参数α(内容权重)和β(网络权重)的加权融合模型,整合内容与网络信号。
- 采用基于共享焦点与提问者匹配度的检索框架,对潜在回答者进行排序,使用MRR和MAP@5等指标进行评估。
- 将Twitter上的用户生成问题作为信息寻求行为的实例,将其视为需由社交关联用户回答的查询。
- 通过人工标注,将问题分类为“建议”、“意见”、“请求帮助”和“反问”等类型,以支持评估。
实验结果
研究问题
- RQ1如何有效结合网络与内容信息,以识别社交媒体中主观性问题的回答者?
- RQ2相较于基线方法,共享社交焦点(如兴趣、从属关系)在多大程度上能提升相关回答者的识别效果?
- RQ3该框架在社交媒体问题的不同类别(如建议、意见、反问)中的表现如何?
- RQ4该框架对网络与内容信息相对比例变化的鲁棒性如何?
- RQ5基于社交焦点的方法能否有效识别出如Twitter等平台上普遍存在的个人化、非事实性问题的回答者?
主要发现
- 针对‘建议’类问题,该框架的MAP@5达到4.68%,较最接近的基线方法提升1.78%。
- 对于‘请求帮助’类问题,该框架的MAP@5为4.39%,较基线方法提升1.01%。
- 在所有α与β参数组合下,该框架的MAP值均高于3%,表明其对网络与内容信息比例变化具有强鲁棒性。
- 性能最低的是‘反问’类问题(MAP@5 = 0%),表明此类问题可能不反映真实的信息需求,且较难通过焦点匹配方法有效识别。
- 配对t检验确认,该框架在所有问题类别中相较基线的性能提升均具有统计显著性。
- 该框架显著优于随机排序,即使在最差参数设置下,其最低性能也超过随机选择的两倍以上,证明其在次优参数配置下仍具高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。