[论文解读] What do Vegans do in their Spare Time? Latent Interest Detection in Multi-Community Networks
本文提出一种方法,通过对比 Reddit 多社区网络中基于用户和基于内容的相似性,检测‘潜在兴趣’——即意外的社区关系。基于涵盖 3,200 个子版面的 660 万篇帖子的数据集,该方法识别出用户基础高度相似但语言内容差异显著的子版面,揭示了诸如素食主义者参与体育或政治社区与游戏论坛重叠等隐藏兴趣。
Most social network analysis works at the level of interactions between users. But the vast growth in size and complexity of social networks enables us to examine interactions at larger scale. In this work we use a dataset of 76M submissions to the social network Reddit, which is organized into distinct sub-communities called subreddits. We measure the similarity between entire subreddits both in terms of user similarity and topical similarity. Our goal is to find community pairs with similar userbases, but dissimilar content; we refer to this type of relationship as a "latent interest." Detection of latent interests not only provides a perspective on individual users as they shift between roles (student, sports fan, political activist) but also gives insight into the dynamics of Reddit as a whole. Latent interest detection also has potential applications for recommendation systems and for researchers examining community evolution.
研究动机与目标
- 识别用户基础相似但内容不同的异常社区关系,称为‘潜在兴趣’。
- 探索多社区网络如何揭示个体互动之外的用户角色与社会动态。
- 开发一种结合用户与文本相似性的方法,以检测新颖且非显而易见的社区配对。
- 为推荐系统提供基础,通过双相似性度量平衡新颖性与相似性。
- 发布一个经过筛选、平衡的 660 万篇 Reddit 帖子语料库,供未来研究社区结构与内容互动。
提出的方法
- 使用共享发帖人集合的 Jaccard 相似性计算子版面之间的用户相似性。
- 使用主题模型(LDA)和主题分布的余弦相似性测量子版面之间的文本相似性。
- 应用启发式评分函数:LI(A,B) = S_user(A,B) × (1 - S_text(A,B)),以优先考虑高用户重叠与低内容重叠。
- 通过筛选用户相似度最高的前 100 个子版面,并排除在文本相似度中排名前 500 的子版面,识别潜在兴趣。
- 使用 LDA 从每个子版面的内容中提取主导主题,以验证检测到的潜在兴趣在语义上的差异性。
- 采用数据处理管道,筛选出至少包含 500 篇帖子且至少有 300 名独立用户的子版面,并将大型子版面限制在 5,000 篇采样帖子以内,以避免偏差。
实验结果
研究问题
- RQ1哪些社区拥有相似的用户基础但内容显著不同,表明可能存在潜在兴趣?
- RQ2如何结合基于用户和基于内容的相似性,揭示仅靠单一度量无法检测到的社区关系?
- RQ3检测到的潜在兴趣在多大程度上反映了社区之间有意义且非平凡的联系?
- RQ4潜在兴趣检测能否通过整合用户行为与内容多样性,提升推荐系统性能?
- RQ5多社区成员身份(如体育、政治或生活方式子版面)在多大程度上影响潜在兴趣的识别?
主要发现
- 在 /r/Liberal 的前 10 个潜在兴趣中,有 7 个未出现在仅基于用户或文本相似性的前 10 名中,表明实现了新颖发现。
- 在 /r/Conservative 中,前 10 个潜在兴趣中有 8 个未出现在任一单一指标的前 10 名中,证实该方法能够揭示出人意料的关系。
- 该方法成功识别出素食主义者经常参与 /r/fitness 和 /r/vegan 等子版面,表明其存在超越素食主义本身的健康与生活方式兴趣。
- 潜在兴趣检测方法的结果与单一指标方法截然不同,表明双相似性对比能增强对非显而易见社区关联的发现能力。
- 该方法揭示了 /r/vegan 和 /r/fitness 等社区存在高用户重叠但语言截然不同,表明用户同时参与基于身份认同和基于生活方式的论坛。
- 本研究发布了包含 660 万篇 Reddit 帖子的筛选后、平衡的语料库,涵盖 3,200 个子版面,以支持未来对社区动态与内容-用户对齐的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。