Skip to main content
QUICK REVIEW

[論文レビュー] ScoreGAN: A Fraud Review Detector based on Multi Task Learning of Regulated GAN with Data Augmentation

Saeedreza Shehnepoor, Roberto Togneri|arXiv (Cornell University)|Jun 11, 2020
Spam and Phishing Detection参考文献 36被引用数 5
ひとこと要約

ScoreGANは、情報利得最大化(IGM)を用いてレビュー本文とスコアを同時にモデル化することで、スコア関連のボット風レビューを生成する規制付きGANフレームワークを提案する。スコアを損失関数に組み込むことで、GANの安定性が向上し、識別器の一般化性能が向上し、YelpではFakeGANに比べ7%高い平均適合率(AP)を達成し、TripAdvisorでは5%高いAPを達成した。

ABSTRACT

The promising performance of Deep Neural Networks (DNNs) in text classification, has attracted researchers to use them for fraud review detection. However, the lack of trusted labeled data has limited the performance of the current solutions in detecting fraud reviews. The Generative Adversarial Network (GAN) as a semi-supervised method has demonstrated to be effective for data augmentation purposes. The state-of-the-art solutions utilize GANs to overcome the data scarcity problem. However, they fail to incorporate the behavioral clues in fraud generation. Additionally, state-of-the-art approaches overlook the possible bot-generated reviews in the dataset. Finally, they also suffer from a common limitation in scalability and stability of the GAN, slowing down the training procedure. In this work, we propose ScoreGAN for fraud review detection that makes use of both review text and review rating scores in the generation and detection process. Scores are incorporated through Information Gain Maximization (IGM) into the loss function for three reasons. One is to generate score-correlated reviews based on the scores given to the generator. Second, the generated reviews are employed to train the discriminator, so the discriminator can correctly label the possible bot-generated reviews through joint representations learned from the concatenation of GLobal Vector for Word representation (GLoVe) extracted from the text and the score. Finally, it can be used to improve the stability and scalability of the GAN. Results show that the proposed framework outperformed the existing state-of-the-art framework, namely FakeGAN, in terms of AP by 7\%, and 5\% on the Yelp and TripAdvisor datasets, respectively.

研究の動機と目的

  • 生成モデルを活用することで、不正レビュー検出におけるデータ不足問題に対処する。
  • 既存のGANベースの手法が、スコアなどのメタデータと関連付けられた生成レビューを正しく生成できないという限界を克服する。
  • スコアに敏感な生成によってボットが生成するレビューを明示的にモデル化することで、検出の耐性を高める。
  • 損失関数に情報利得最大化(IGM)を適用することで、GANの訓練を安定化させ、複数のデータセットにわたるスケーラビリティを向上させる。
  • 本物に似たスコア関連の偽のレビューを生成することで、半教師あり不正レビュー検出のための有効なデータ拡張を可能にする。

提案手法

  • 本物/偽のレビュー分類のための識別器と、人間/ボット生成の不正レビューを区別するための識別器の2つの識別器を備えた二重識別器GANアーキテクチャを採用する。
  • 情報利得最大化(IGM)を介して、レビューのスコアを生成器の損失関数に統合し、生成されたレビューが入力スコアと相関するように保証する。
  • テキストのためのGLoVe埋め込みとメタデータのためのスコアベクトルの共同表現を用いて、識別器を訓練し、検出性能を向上させる。
  • IGMを用いて、スコアに対して最大の情報利得を持つ生成サンプルを選択することで、より本物に似た人間らしい不正レビューの生成を促進する。
  • 生成されたレビューをデータ拡張に活用することで、YelpやTripAdvisorなどの複数のデータセットにわたる一般化とスケーラビリティを向上させる。
  • IGMによる正則化をGANの目的関数に適用することで、訓練の安定性を高め、一般的なGANの不安定性や収束問題を緩和する。

実験結果

リサーチクエスチョン

  • RQ1スコアをGANの損失関数に組み込むことで、生成される不正レビューの質と現実性が向上するか?
  • RQ2スコアに相関するデータ生成は、識別器がボット生成レビューを検出する能力を向上させるか?
  • RQ3IGMに基づく損失正則化は、不正レビュー検出におけるGAN訓練の安定化と収束改善を実現するか?
  • RQ4AP、AUC、正答率の観点から、ScoreGANはFakeGANのような最先端手法と比較して、異なるデータセットでどの程度の性能を示すか?
  • RQ5ScoreGANを用いたデータ拡張は、小規模または不均衡なトレーニングデータセットにおいて、モデルの耐性をどの程度向上させるか?

主な発見

  • Yelpデータセットでは、ScoreGANは平均適合率(AP)65.16%を達成し、最先端のFakeGANフレームワークに比べ7%の向上を示した。
  • TripAdvisorデータセットでは、ScoreGANはFakeGANに比べ5%高いAPを達成し、分野を越えて一貫した性能向上を示した。
  • ScoreGANは、訓練データサイズを400件にまで減らしても、最小限の性能変動で安定性とスケーラビリティを示した。
  • クロスデータセット評価では、ScoreGANの性能は一貫性があり、特にTripAdvisorでは訓練データ量の増加に伴い性能が向上した。
  • YelpではAUCが88.78%に達し、FakeGANおよびNetSpam、Liら、Shaalanらなどの他のベースラインを大きく上回った。
  • ScoreGANは、特にYelpのように本物のレビューが不正レビューに比べて圧倒的に多いデータセットにおいて、効果的なスコアに敏感なデータ拡張により、データの不均衡に対する優れた耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。