[论文解读] Exploring Linkablility of Community Reviewing
本文利用大规模Yelp数据集上的简单统计模型,研究了社区评论平台中匿名评论的可链接性。研究发现,活跃贡献者撰写的评论中高达99%可仅凭写作风格以高置信度实现链接,揭示了由于评论中作者特征的一致性而带来的显著隐私风险。
Large numbers of people all over the world read and contribute to various review sites. Many contributors are understandably concerned about privacy; specifically, about linkability of reviews (and accounts) across review sites. In this paper, we study linkability of community reviewing and try to answer the question: to what extent are "anonymous" reviews linkable, i.e., likely authored by the same contributor? Based on a very large set of reviews from a popular site (Yelp), we show that a high percentage of ostensibly anonymous reviews can be linked with very high confidence. This is despite the fact that we use very simple models and equally simple features set. Our study suggests that contributors reliably expose their identities in reviews. This has important implications for cross-referencing accounts between different review sites. Also, techniques used in our study could be adopted by review sites to give contributors feedback about privacy of their reviews.
研究动机与目标
- 评估看似匿名的社区评论网站评论在多大程度上可被链接至同一作者。
- 探究跨评论中一致的写作风格是否能实现对贡献者的高置信度再识别。
- 探索通过评论链接性检测垃圾评论或自评行为的可行性。
- 为评论网站提供一种隐私意识反馈机制,以告知用户其评论的可链接性风险。
提出的方法
- 仅使用字母频率分布作为特征,应用朴素贝叶斯分类器,将匿名评论分类至作者组别。
- 使用Kullback-Leibler散度衡量评论特征分布之间的相似性,以评估链接性。
- 采用拉普拉斯平滑处理概率估计中的零频特征。
- 利用超过100万条来自约2,000名活跃Yelp贡献者的大型数据集评估链接性。
- 将每位贡献者的所有评论视为单一作者档案,并测试将匿名评论归入正确档案的能力。
- 使用精确率、召回率和F1分数评估性能,结果按每位作者的匿名评论数量变化进行报告。
实验结果
研究问题
- RQ1仅使用基本文本特征,匿名评论在多大程度上可被链接至同一作者?
- RQ2每位贡献者所写评论数量的变化如何影响评论的链接性?
- RQ3朴素贝叶斯等简单模型能否仅凭评论文本实现高准确率的作者识别?
- RQ4高链接性对跨多个评论平台用户隐私有何影响?
- RQ5该方法是否可用于检测评论生态系统中的自评或垃圾评论行为?
主要发现
- 高达83%的匿名评论可仅凭字母频率分布被链接至原始作者。
- 对于撰写60篇或以上评论的贡献者,链接性最高可达99%。
- 朴素贝叶斯模型仅使用简单特征即实现高精确率与高召回率,表明即使缺乏复杂语言特征,性能依然出色。
- 研究证实,用户在其写作中持续暴露可识别特征,使其在跨评论中极易被链接。
- 结果表明,由于写作风格稳定,跨不同评论网站交叉验证账户高度可行。
- 该方法可被评论平台用于向用户提供其评论隐私风险的反馈。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。