Skip to main content
QUICK REVIEW

[論文レビュー] Combating Fraud in Online Social Networks: Detecting Stealthy Facebook Like Farms

Muhammad Ikram, Lucky Onwuzurike|arXiv (Cornell University)|Jun 1, 2015
Spam and Phishing Detection参考文献 27被引用数 3
ひとこと要約

本稿では、従来のグラフ共クラスタリング手法では検出できない巧妙なFacebookのいいね農場を特定するため、タイムラインに基づく機械学習手法を提案する。ユーザーのタイムライン投稿から語彙的および非語彙的特徴(語数の減少、語彙多様性の低さ、共有コンテンツの繰り返し)を分析し、SVM分類器を構築。その結果、最大100%の精度と97%の再現率を達成し、既存のグラフベースの検出手法を著しく上回った。

ABSTRACT

As businesses increasingly rely on social networking sites to engage with their customers, it is crucial to understand and counter reputation manipulation activities, including fraudulently boosting the number of Facebook page likes using like farms. To this end, several fraud detection algorithms have been proposed and some deployed by Facebook that use graph co-clustering to distinguish between genuine likes and those generated by farm-controlled profiles. However, as we show in this paper, these tools do not work well with stealthy farms whose users spread likes over longer timespans and like popular pages, aiming to mimic regular users. We present an empirical analysis of the graph-based detection tools used by Facebook and highlight their shortcomings against more sophisticated farms. Next, we focus on characterizing content generated by social networks accounts on their timelines, as an indicator of genuine versus fake social activity. We analyze a wide range of features extracted from timeline posts, which we group into two main classes: lexical and non-lexical. We postulate and verify that like farm accounts tend to often re-share content, use fewer words and poorer vocabulary, and more often generate duplicate comments and likes compared to normal users. We extract relevant lexical and non-lexical features and and use them to build a classifier to detect like farms accounts, achieving significantly higher accuracy, namely, at least 99% precision and 93% recall.

研究の動機と目的

  • 従来のグラフ共クラスタリング不正検出ツールが、通常のユーザー行動を模倣する巧妙ないいね農場を特定できないという限界を解消すること。
  • タイムラインに基づく特徴(語彙的および非語彙的)が、いいね農場アカウントと本物のユーザーを効果的に区別できるかどうかを調査すること。
  • タイムライン特徴を用いた教師あり機械学習分類器の開発と評価を行い、巧妙ないいね農場アカウントの高精度な検出を実現すること。
  • タイムライン特徴が、時間的パターンや社会的グラフパターンのみに依存する手法よりも、洗練された低リスクないいね農場の検出に優れていることを示すこと。

提案手法

  • 過去のハニーポットキャンペーンを通じて、いいね農場アカウントおよび通常のユーザーのベースラインからタイムラインデータを収集した。
  • タイムライン投稿から語彙的特徴(語数、語彙多様性、読みやすさスコア)を抽出した。
  • 非語彙的特徴(共有コンテンツの頻度、重複するコメント、繰り返しのいいね)を抽出した。
  • 語彙的および非語彙的特徴を統合した特徴ベクトルを分類に用いた。
  • グランド・トゥースデータセット上で、SVM、決定木、AdaBoost、kNN、ランダムフォレスト、ナイーブベイズなど複数の分類器を訓練・評価した。
  • すべてのキャンペーンおよび特徴セットにおいて性能が優れていたことから、SVMを最適な分類器として選定した。

実験結果

リサーチクエスチョン

  • RQ1CopyCatch や SynchroTrap などのグラフ共クラスタリング手法は、通常のユーザー行動を模倣する巧妙ないいね農場を効果的に検出できるか?
  • RQ2いいね農場アカウントと通常のユーザーのタイムライン投稿には、語彙的および非語彙的特徴にどのような差があるか?
  • RQ3タイムライン特徴を学習データとして用いた機械学習分類器は、グラフベース手法よりも高い正確性でいいね農場アカウントを検出できるか?
  • RQ4語数、語彙多様性、読みやすさといった語彙的特徴は、いいね農場アカウントと通常のユーザーの投稿でどのように異なるか?
  • RQ5共有コンテンツや重複する相互作用といった非語彙的特徴は、いいね農場と本物のユーザー行動をどの程度明確に区別できるか?

主な発見

  • CopyCatch や SynchroTrap などのグラフ共クラスタリング手法は、通常のユーザー行動を模倣するため、巧妙ないいね農場の検出において高い偽陽性率を示す。
  • いいね農場の投稿は、通常のユーザーの投稿に比べて平均で43%少ない語数を含み、語彙多様性が低く、読みやすさが著しく低い。
  • いいね農場の投稿の大部分は、繰り返しのリンク、記事、動画を含む、オリジナルでない共有コンテンツで構成されており、自動的または反復的な行動を示している。
  • 語彙的および非語彙的特徴を統合したSVM分類器は、最大100%の精度と97%の再現率を達成し、すべてのキャンペーンで少なくとも99%の精度と93%の再現率を達成した。
  • SVM分類器は、決定木、AdaBoost、kNN、ランダムフォレスト、ナイーブベイズを含む、他のすべてのテスト済みアルゴリズムを検出精度で上回った。
  • 通常のユーザーの文章作成および相互作用パターンを模倣するコストが非常に高いため、行動の模倣による回避はいいね農場にとって経済的に非現実的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。