Skip to main content
QUICK REVIEW

[論文レビュー] Voting for Deceptive Opinion Spam Detection

Tao Wang, Hua Zhu|arXiv (Cornell University)|Sep 16, 2014
Spam and Phishing Detection参考文献 20被引用数 4
ひとこと要約

本稿では、N-gram、POSタグ、TF-IDF、およびLSI/Sprinkled LSI次元削減を用いた複数のテキスト分類手法を統合する投票ベースのアンサンブル手法を提案する。SVMおよびナイーブベイズ分類器を併用し、だましの意見スパムを検出する。主な貢献は、投票による95%の正確度であり、個々のモデルを著しく上回る。特に、Sprinkled LSI + SVMは次元500で90%の正確度を達成した。

ABSTRACT

Consumers' purchase decisions are increasingly influenced by user-generated online reviews. Accordingly, there has been growing concern about the potential for posting deceptive opinion spam fictitious reviews that have been deliberately written to sound authentic, to deceive the readers. Existing approaches mainly focus on developing automatic supervised learning based methods to help users identify deceptive opinion spams. This work, we used the LSI and Sprinkled LSI technique to reduce the dimension for deception detection. We make our contribution to demonstrate what LSI is capturing in latent semantic space and reveal how deceptive opinions can be recognized automatically from truthful opinions. Finally, we proposed a voting scheme which integrates different approaches to further improve the classification performance.

研究の動機と目的

  • 人間が真実バイアスや微細な言語的手がかりにより識別が難しいため、オンラインレビューにおけるだましの意見スパムの検出を改善すること。
  • スパム検出における高次元で過学習を起こしやすいテキスト特徴量の性質に対処するため、次元削減技術を適用すること。
  • 多様な特徴表現とアルゴリズムの長所を活かすために、投票方式による複数モデルの統合により分類性能を向上させること。
  • 標準LSIと比較して、Sprinkled LSIが、だましのレビューと真実のレビューを区別するための潜在的意味的パターンを捉える上で優れているかどうかを検証すること。
  • n-gram、POSタグ、TF-IDF特徴量を、教師あり次元削減とSVMやナイーブベイズといった堅牢な分類器と組み合わせることの有効性を検証すること。

提案手法

  • N-gram言語モデル、POSタギング、TF-IDFを用いて、言語的および統計的特徴量を抽出するためのテキスト前処理を行う。
  • 特徴量行列の次元削減のため、特異値分解(SVD)を用いたラテンセマンティックインデクシング(LSI)およびスパム付きLSI(教師ありLSI)を適用する。
  • 生の特徴量空間および次元削減後の空間において、サポートベクターマシン(SVM)およびナイーブベイズ分類器を学習する。
  • 重み付き投票方式を用い、最終予測は5つの異なるモデル(Sprinkled LSI + SVM(500D)、Sprinkled LSI + SVM(300D)、ユニグラム + SVM、TF-IDF + SVM、ユニグラム + ナイーブベイズ)の過半数による予測に基づく。
  • LSI/Sprinkled LSIにおける次元の最適化によりモデル性能を向上させ、過学習を避けるために訓練精度とテスト精度のトレードオフを観察する。
  • 標準指標(正確度、適合率、F1スコア)を用いてモデルを評価し、未学習のテストデータに対する汎化性能に特に注目する。

実験結果

リサーチクエスチョン

  • RQ1N-gram、POS、TF-IDFといった複数の特徴表現を組み合わせることで、単一の表現を使用する場合と比較して、だましの意見スパムの検出性能が向上するか?
  • RQ2特に低次元において、標準LSIと比較してSprinkled LSIが、だましのレビューを検出する上で顕著な性能向上をもたらすか?
  • RQ3多様な分類器のアンサンブルによる投票方式は、個々のモデルと比較して、だましのレビューと真実のレビューを分類する際にどの程度優れた性能を示すか?
  • RQ4LSI分析によって明らかになった言語的パターン(例:第2人称代名詞の使用、具体的な形容詞の欠如)は、オンラインレビューにおけるだましの兆候としてどの程度顕著か?
  • RQ5LSIベースのスパム検出において、どの次元で過学習が性能を劣化させるようになるか?また、これはモデルの汎化性能にどのように影響するか?

主な発見

  • 投票アンサンブル手法により95%の正確度を達成し、最高の個別モデル(Sprinkled LSI + SVMが90%)を著しく上回った。
  • Sprinkled LSI + SVMが500次元で90%の正確度を達成した。これは、教師あり次元削減が標準LSIよりも検出性能を向上させることを示している。
  • テスト正確度は次元500付近でピークに達した。それ以上になると、訓練正確度は上昇するがテスト正確度が低下し、過学習が発生した。
  • 2人称代名詞(例:'you'、'your')の使用が、1人称代名詞よりもだましのレビューを示す指標としてより顕著であった。これは以前の仮説と矛盾する。
  • だましのレビューは、具体的な名詞や形容詞が欠如していることが特徴であり、より一般的で曖昧な言語的スタイルであると示唆された。
  • n-gramベースのモデルが個別に最も高い性能を示し、だましスパムを検出するにあたりキーワードレベルの特徴量の重要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。