Skip to main content
QUICK REVIEW

[論文レビュー] Online Deception Detection Refueled by Real World Data Collection

Wenlin Yao, Zeyu Dai|arXiv (Cornell University)|Jul 28, 2017
Spam and Phishing Detection参考文献 23被引用数 5
ひとこと要約

本稿では、協調的なレビューキャンペーンを特定するためのソーシャルネットワーク分析を用いて、大規模で現実世界の偽りのオンラインレビューを収集するスケーラブルな手法を提案する。レビュアー同士の相互作用グラフを活用することで、30以上の製品分野にまたがり、10,000件を超える偽りのレビューを収集した。一般化された言語的特徴—特に広告語と文の複雑さ—を用いることで、多様なデータで訓練された場合、分野をまたがる偽り検出性能が著しく向上し、Fスコアはレビュアーのタイプの整合性に応じて30%から80%に向上した。

ABSTRACT

The lack of large realistic datasets presents a bottleneck in online deception detection studies. In this paper, we apply a data collection method based on social network analysis to quickly identify high-quality deceptive and truthful online reviews from Amazon. The dataset contains more than 10,000 deceptive reviews and is diverse in product domains and reviewers. Using this dataset, we explore effective general features for online deception detection that perform well across domains. We demonstrate that with generalized features - advertising speak and writing complexity scores - deception detection performance can be further improved by adding additional deceptive reviews from assorted domains in training. Finally, reviewer level evaluation gives an interesting insight into different deceptive reviewers' writing styles.

研究の動機と目的

  • オンライン偽り検出研究における小規模で人工的なデータセットのボトル neck を克服すること。
  • 多様な分野とレビュアーから偽りのレビューを収集できるスケーラブルで現実世界のデータ収集手法を開発すること。
  • 複数の製品分野にまたがって効果的な一般化可能な言語的特徴を同定すること。
  • レビュアー固有の文章スタイルが偽り検出性能に与える影響を評価すること。
  • 多様な分野からの訓練データの増加が、一般化特徴を用いても検出性能を向上させることを示すこと。

提案手法

  • 協調的なレビューキャンペーンを特定するためにレビュアー同士のグラフにソーシャルネットワーク分析を適用すること。
  • 検出されたネットワークパターンを活用して、高信頼性の偽りのレビュアーとその関連レビューを同定すること。
  • 30以上の製品分野にまたがり、1,540人のレビュアーから成る10,000件を超える偽りのレビューのデータセットを構築すること。
  • 一般化された言語的特徴(例:広告語、Flesch-Kincaidスコア、音節数)を用いること。
  • 分野をまたがる訓練とレビュアー単位の評価を用いて、偽り検出分類器を訓練および評価すること。
  • 訓練データ量の増加に伴う性能向上を評価するための学習曲線を生成すること。

実験結果

リサーチクエスチョン

  • RQ1ソーシャルネットワーク分析に基づくスケーラブルなデータ収集手法は、大規模で現実的な偽りのオンラインレビューのデータセットを生成できるか?
  • RQ2多様な製品分野において、偽り検出に最も効果的な一般化された言語的特徴は何か?
  • RQ3多様な分野からの偽りの訓練データ量の増加が、検出性能に与える影響は何か?
  • RQ4レビュアー固有の文章スタイルは、偽り検出モデルの一般化にどの程度影響を及えるか?
  • RQ5ある種の偽りのレビュアーで訓練されたモデルが、別の種類のレビュアーに対して一般化がうまくいかない場合があり、その影響は性能にどのように現れるか?

主な発見

  • 提案手法により、30以上の製品分野にまたがり、1,540人のレビュアーから10,000件を超える偽りのレビューが収集され、過去のデータセットと比較して2桁の増加が達成された。
  • 一般化特徴—特に広告語と文の複雑さ—を用いることで、分野をまたがる偽り検出性能が著しく向上した。
  • 訓練データ量の増加に伴い性能が一貫して向上した:同じレビュアーのタイプで訓練・テストした場合、Fスコアは30%から80%に上昇したが、あるタイプで訓練し別のタイプでテストした場合、性能が低下した。
  • 学習曲線から、多様な訓練データ量の増加に伴い性能が継続的に向上することが示され、スケーラビリティと一般化の利点が裏付けられた。
  • レビュアー単位の分析から、2種類の明確な偽りの文章スタイルが特定された:1つは短く、プロモーション指向の言葉を用いるスタイル、もう1つは長く、感情的で個人的な参照を含む文のスタイル。
  • 本研究は、特に文章スタイルをモデル化する場合に、大規模で現実世界のデータが一般化ルールを解明するために不可欠であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。