Skip to main content
QUICK REVIEW

[論文レビュー] Detection of Fake Users in SMPs Using NLP and Graph Embeddings

Manojit Chakraborty, Shubham Das|arXiv (Cornell University)|Apr 27, 2021
Spam and Phishing Detection参考文献 21被引用数 4
ひとこと要約

本稿では、フォロワー・フォロー関係ネットワークからのグラフ埋め込み、自然言語処理(NLP)で抽出したテキスト特徴量、およびユーザーメタデータを組み合わせることで、本物のユーザと偽物のユーザを区別する、Twitter用の新しいスパム検出手法を提案する。XGBoostを用い、最新で更新された46,354件のアクティブなアカウントから構成される新規データセットで実験した結果、96.99%の精度を達成し、より最近で困難なデータに対して、先行研究を上回る性能を示した。

ABSTRACT

Social Media Platforms (SMPs) like Facebook, Twitter, Instagram etc. have large user base all around the world that generates huge amount of data every second. This includes a lot of posts by fake and spam users, typically used by many organisations around the globe to have competitive edge over others. In this work, we aim at detecting such user accounts in Twitter using a novel approach. We show how to distinguish between Genuine and Spam accounts in Twitter using a combination of Graph Representation Learning and Natural Language Processing techniques.

研究の動機と目的

  • 従来の検出システムを回避するように進化した現代のスパムアカウントと偽物アカウントを検出する課題に対処すること。
  • 現在のスパム行動を反映していない、古くさいまたは無効化されたアカウントに依存する既存のデータセットの限界を克服すること。
  • ユーザーメタデータ、NLP技術、およびグラフベースの表現を組み合わせることで、現在のアクティブなアカウントに対する検出精度を向上させる、堅牢な検出フレームワークを開発すること。
  • Twitter自身のスパムフィルタを通過した多くのアカウントを含む、46,354件のアクティブなTwitterアカウントから構成される、新規で最新のデータセットを構築すること。

提案手法

  • 公的ソースおよびTwitter APIから126,503件のTwitterユーザIDを収集し、非アクティブアカウントを除外することで、ラベルが確認済みの46,354件のアクティブアカウントを保持した。
  • Twitter APIを用いて、各ユーザの37個のユーザーメタデータ特徴量(例:フォロワー数、認証ステータス、アカウント作成日)および全ツイート本文を抽出した。
  • TF-IDFおよびBERTベースの文書埋め込みを用いて、ツイートコンテンツ内の言語的パターンを捉えるNLP特徴量を生成した。
  • ユーザ間の接続関係からフォロワー・フォローリンググラフを構築し、グラフの中心性指標(次数、中間性、固有ベクトル、PageRank)およびnode2vec埋め込みを計算することで、ネットワーク内での構造的役割を捉えた。
  • メタデータ、NLP、およびグラフ特徴量を統合し、1ユーザあたり116次元の特徴量ベクトルを生成した。
  • 複数の教師あり機械学習モデルを訓練および評価し、グリッドサーチによるハイパーパramータチューニング(学習率0.1、最大深さ15)を経て、XGBoostを最良の性能を示すモデルとして選定した。

実験結果

リサーチクエスチョン

  • RQ1NLP、ユーザーメタデータ、およびグラフ埋め込みを統合したハイブリッド手法は、従来の検出システムを回避した現代の偽Twitterアカウントを効果的に検出できるか?
  • RQ2Twitter自身のスパムフィルタを通過した多くのアクティブアカウントを含む、新規で最新のデータセットで学習した場合、過去のデータセットと比較してモデルの性能はどのように変化するか?
  • RQ3グラフベースの構造的特徴量(例:中心性、node2vec埋め込み)は、従来のメタデータおよびNLP特徴量に加えて、スパム検出性能をどの程度向上させるか?
  • RQ4BERTベースの埋め込みの統合は、単純なNLP手法と比較して、スパムコンテンツ内の微細な言語的パターンを検出する能力を向上させるか?
  • RQ5SVM、ランダムフォレスト、GBMなどの他の最先端モデルと比較して、XGBoostの性能は、この新規で困難なアクティブアカウントのデータセット上でどのように差がつくか?

主な発見

  • XGBoostモデルはテストセットで96.99%の最高精度を達成し、ランダムフォレスト(94.98%)やLightGBM(88.49%)といった他のモデルを顕著に上回った。
  • スパムアカウント(クラス1)では97.90%の精度を達成しており、それらが現在もアクティブで、プラットフォームレベルのフィルタを回避しているにもかかわらず、悪意あるアカウントの検出能力が非常に高いことが示された。
  • 本手法は、イガワら(96.6%)およびバロールら(95%)が使用したような、より小さいかつ古くなったデータセットを用いた先行研究を上回り、46,354件のアクティブアカウントから構成されるより大規模で最新のデータセットでも優れた性能を示した。
  • F1スコアが0.97であることは、真のアカウントとスパムアカウントの両方において、高い適合率と再現率を達成しており、バランスの取れた性能を示している。
  • node2vecによるグラフ埋め込みおよびNLP特徴量(特にBERTベースの埋め込み)の使用が、コミュニティレベルの行動や言語的スタイルのスパムパターンを区別する上で顕著に寄与した。
  • データセットの品質—Twitter自身のスパム検出を通過したアクティブなアカウントのみを含む—を踏まえると、96.99%という精度は特に注目すべきものであり、洗練された、検出が困難なスパムアカウントの検出を反映している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。