[論文レビュー] Modeling Review Spam Using Temporal Patterns and Co-bursting Behaviors
本稿では、Dianping.comの実際のデータから得た大規模なリアルワールドデータセットを用いて、レビューのタイムスタンプのみを用いて、活動的・不活性状態の二モードに分かれる時間的投稿パターンを分析することで、意見スパム投稿者を検出する二モードのラベル付き隠れマルコフモデル(LHMM)を提案する。さらに、共発生ネットワークを導入し、複数の製品にわたる同期的なレビューの急増を捉えることで、共謀的スパム投稿者グループを特定する。この手法は、スパム投稿者検出およびグループクラスタリングの分野で、最先端の手法を著しく上回る性能を発揮する。
Online reviews play a crucial role in helping consumers evaluate and compare products and services. However, review hosting sites are often targeted by opinion spamming. In recent years, many such sites have put a great deal of effort in building effective review filtering systems to detect fake reviews and to block malicious accounts. Thus, fraudsters or spammers now turn to compromise, purchase or even raise reputable accounts to write fake reviews. Based on the analysis of a real-life dataset from a review hosting site (dianping.com), we discovered that reviewers' posting rates are bimodal and the transitions between different states can be utilized to differentiate spammers from genuine reviewers. Inspired by these findings, we propose a two-mode Labeled Hidden Markov Model to detect spammers. Experimental results show that our model significantly outperforms supervised learning using linguistic and behavioral features in identifying spammers. Furthermore, we found that when a product has a burst of reviews, many spammers are likely to be actively involved in writing reviews to the product as well as to many other products. We then propose a novel co-bursting network for detecting spammer groups. The co-bursting network enables us to produce more accurate spammer groups than the current state-of-the-art reviewer-product (co-reviewing) network.
研究の動機と目的
- 本稿の目的は、実世界のレビューデータを用いて、偽物のレビュー投稿者と本物のレビュー投稿者との間に顕著な時間的投稿パターンの違いが存在するかを特定することである。
- 本稿の目的は、二モードの投稿行動を活用して個々の意見スパム投稿者を検出できるラベル付き隠れマルコフモデル(LHMM)を開発することである。
- 本稿の目的は、複数の製品にわたる同期的なレビューの急増を捉えることで、共謀的スパム投稿行動をモデル化する共発生ネットワークを導入することである。
- 本稿の目的は、正確なスパムラベルが付与された大規模かつ現実的なデータセットを用いて、提案手法の性能を評価し、最先端の手法と信頼性を持って比較できるようにすることである。
提案手法
- 著者らは、活動的(高い投稿レート)と不活性(低い投稿レート)の2状態を持つ隠れマルコフモデル(HMM)として、レビュー投稿行動をモデル化する。
- HMMを拡張し、ユーザーの時間的投稿パターンに基づいてスパム投稿者である確率を推定できるラベル付きHMM(LHMM)に発展させる。
- このモデルはレビューのタイムスタンプのみを用いるため、軽量であり、さまざまなレビュー・プラットフォームに応用可能である。
- 共発生ネットワークは、複数の製品にわたるレビューの急増が同期しているレビュー投稿者同士を接続することで構築される。
- Louvain、K-means、階層的クラスタリングなどのクラスタリングアルゴリズムを共発生ネットワークに適用し、スパム投稿者グループを検出する。
- 検出されたスパム投稿者グループの品質を比較評価するために、純度(purity)とエントロピー(entropy)を評価指標として用いる。
実験結果
リサーチクエスチョン
- RQ1スパム投稿者と本物のレビュー投稿者は、実世界のレビュー・データにおいて、明確に二モードの時間的投稿パターンを示すのか?
- RQ2ラベル付き隠れマルコフモデル(LHMM)は、レビューのタイムスタンプと時間的行動のみを用いて、個々のスパム投稿者を効果的に検出できるのか?
- RQ3スパム投稿者は、複数の製品にわたって協調的なレビューの急増を頻繁に行うのか?これは共謀的行動を示唆するのか?
- RQ4共発生ネットワークは、既存の共レビュー・ネットワークと比較して、共謀的スパム投稿者グループを検出する上で優れた性能を示すのか?
- RQ5LHMMの隠れ状態は、協調的スパム投稿行動を特定するための信頼できる指標として機能するのか?
主な発見
- LHMMモデルは、言語的特徴と行動特徴を用いた教師あり学習を上回り、時間的パターン解析により高い精度で個々のスパム投稿者を検出できる。
- スパム投稿者は、本物のレビュー投稿者と比較して、連続するレビューの平均間隔がはるかに短いことが確認され、投稿行動の違いが明確に示された。
- スパム投稿者は、不活性状態から活動的状態に移行する頻度が高く、より高いバースト性を示すが、非スパム投稿者とは逆のパターンを示す。
- 共発生ネットワークは、共レビュー・ネットワークよりも高いクラスタリング純度(0.88)と低いエントロピー(0.76)を達成し、共謀的スパム投稿者グループの検出において優れた性能を示した。
- 近隣のレストランの日次スパムレビューの急増の間には強い正の相関が存在し(時間系列データで明確に可視化)、スパム投稿者コミュニティによる共謀的キャンペーンが行われている可能性が示唆された。
- モデルの隠れ状態は、従来の特徴ベースのフィルタが検出できない難易度の高い共謀的スパム投稿者グループを効果的に特定する手がかりを提供した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。