[论文解读] Modeling Review Spam Using Temporal Patterns and Co-bursting Behaviors
本文提出一种双模式标记隐马尔可夫模型(LHMM),通过仅分析评论时间戳中的双峰时间发布模式(活跃与非活跃状态),检测意见刷屏者。此外,还引入共爆发网络以揭示共谋刷屏者群体,在来自大众点评网的大规模真实世界数据集上,其在刷屏者检测与群体聚类方面显著优于当前最先进方法。
Online reviews play a crucial role in helping consumers evaluate and compare products and services. However, review hosting sites are often targeted by opinion spamming. In recent years, many such sites have put a great deal of effort in building effective review filtering systems to detect fake reviews and to block malicious accounts. Thus, fraudsters or spammers now turn to compromise, purchase or even raise reputable accounts to write fake reviews. Based on the analysis of a real-life dataset from a review hosting site (dianping.com), we discovered that reviewers' posting rates are bimodal and the transitions between different states can be utilized to differentiate spammers from genuine reviewers. Inspired by these findings, we propose a two-mode Labeled Hidden Markov Model to detect spammers. Experimental results show that our model significantly outperforms supervised learning using linguistic and behavioral features in identifying spammers. Furthermore, we found that when a product has a burst of reviews, many spammers are likely to be actively involved in writing reviews to the product as well as to many other products. We then propose a novel co-bursting network for detecting spammer groups. The co-bursting network enables us to produce more accurate spammer groups than the current state-of-the-art reviewer-product (co-reviewing) network.
研究动机与目标
- 通过真实世界评论数据,识别虚假与真实评论者之间不同的时间发布模式。
- 开发一种标记隐马尔可夫模型(LHMM),利用双峰发布行为检测个体意见刷屏者。
- 通过引入共爆发网络,对跨多个产品的同步评论爆发进行建模,以捕捉协作式刷屏行为。
- 在具有准确刷屏标签的大规模真实数据集上评估所提方法,实现与最先进方法的可靠比较。
提出的方法
- 作者将评论者发布行为建模为一个包含活跃(高发布频率)与非活跃(低发布频率)状态的两状态隐马尔可夫模型(HMM)。
- 将HMM扩展为标记隐马尔可夫模型(LHMM),以基于用户的时间发布模式估计其为刷屏者的可能性。
- 该模型仅使用评论的时间戳,因此轻量化且适用于多种评论平台。
- 通过链接在多个产品上表现出同步评论爆发的评论者,构建共爆发网络,以捕捉共谋行为。
- 在共爆发网络上应用聚类算法(Louvain、K-means、层次聚类),以检测刷屏者群体。
- 使用纯度与熵作为评估指标,将检测到的刷屏者群体质量与真实标签进行比较。
实验结果
研究问题
- RQ1在真实世界评论数据中,刷屏者与真实评论者是否表现出不同的双峰时间发布模式?
- RQ2仅使用评论时间戳与时间行为,标记隐马尔可夫模型能否有效检测个体刷屏者?
- RQ3刷屏者是否频繁在多个产品上发起协调的评论爆发,表明存在共谋行为?
- RQ4共爆发网络与现有共评论网络相比,在检测共谋刷屏者群体方面表现如何?
- RQ5LHMM的隐状态能否作为揭示协作式刷屏活动的可靠指标?
主要发现
- LHMM模型在检测个体刷屏者方面显著优于使用语言与行为特征的监督学习方法,通过时间模式分析实现更高准确率。
- 刷屏者连续评论之间的平均间隔远短于真实评论者,证实了其发布行为的显著差异。
- 与非刷屏者相比,刷屏者更频繁地从非活跃状态转入活跃状态,且爆发性更强;而非刷屏者则表现出相反模式。
- 共爆发网络的聚类纯度(0.88)更高,熵(0.76)更低,优于共评论网络,表明其在检测共谋刷屏者群体方面表现更优。
- 在时间序列数据中可观察到,邻近餐厅的每日虚假评论爆发存在强烈正相关,表明存在由共享刷屏者社区发起的协调刷屏活动。
- 模型的隐状态能有效揭示共谋行为,从而检测出传统基于特征的过滤机制难以捕捉的刷屏者群体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。