[論文レビュー] The Follower Count Fallacy: Detecting Twitter Users with Manipulated Follower Count
本稿では、時間的および行動的特徴に基づく局所的近傍モデルを用いて、偽装されたフォロワー数を有するTwitterユーザーを非教師付きで検出する手法を提案する。この手法は、フォロワー数予測において84.2%の精度を達成し、予測値からの乖離を測定することで、ブラックマーケットサービスによる合成的フォロワー増加に対しても高い耐性を示し、操作されたユーザーを98.62%の精度で検出する。
Online Social Networks (OSN) are increasingly being used as platform for an effective communication, to engage with other users, and to create a social worth via number of likes, followers and shares. Such metrics and crowd-sourced ratings give the OSN user a sense of social reputation which she tries to maintain and boost to be more influential. Users artificially bolster their social reputation via black-market web services. In this work, we identify users which manipulate their projected follower count using an unsupervised local neighborhood detection method. We identify a neighborhood of the user based on a robust set of features which reflect user similarity in terms of the expected follower count. We show that follower count estimation using our method has 84.2% accuracy with a low error rate. In addition, we estimate the follower count of the user under suspicion by finding its neighborhood drawn from a large random sample of Twitter. We show that our method is highly tolerant to synthetic manipulation of followers. Using the deviation of predicted follower count from the displayed count, we are also able to detect customers with a high precision of 98.62%
研究の動機と目的
- ブラックマーケットサービスを用いて意図的にフォロワー数を増やしているTwitterユーザーを特定すること。
- そのユーザーの社会的近隣関係に基づいて、操作に強い現実的で信頼性の高いフォロワー数を推定すること。
- 予測手法が合成的フォロワー操作に対してどれほど耐性を示すかを評価すること。
- フォロワー操作がKloutなどのインフルエンス指標に与える影響と、フォロワー数推定の信頼性を評価すること。
- 真のフォロワー数を前提としない、強固な非教師付き検出フレームワークを提供すること。
提案手法
- 本手法は、投稿頻度やバーストパターンなど、偽造が困難な時間的シグネเจอチャーを用いて、ユーザーの局所的近隣関係を同定する。
- 大規模なランダムサンプルから得たTwitterユーザーの社会的格差、時間的行動、社会的シグネเจอチャー特徴を基に、類似した特徴を持つユーザーをクラスタリングして近隣関係を形成する。
- フォロワー数予測モデルは、ユーザーの近隣の中央値または平均フォロワー数に基づいて、真のフォロワー数を推定する。
- 予測フォロワー数と表示フォロワー数の乖離を、操作の検出シグナルとして用いる。
- 耐性評価のため、ダミーアカウントに対してフォロワー操作をシミュレートし、予測フォロワー数の変化とKloutなどのインフルエンス指標の変化を測定する。
- 耐性指標は、実際の変化量と予測変化量の比として定義され、0.0は完全な耐性、1.0は耐性なしを示す。
実験結果
リサーチクエスチョン
- RQ1時間的シグネเจอチャーを用いて、不自然なフォロワー増加を示すユーザーを信頼性高く同定できるか?
- RQ2近隣ベースのフォロワー数推定手法は、ブラックマーケットフォロワーサービスによる操作に対してどれほど耐性を示せるか?
- RQ3操作されたフォロワー数を持つユーザーの真のフォロワー数をどれほど正確に予測できるか?
- RQ4合成的フォロワー増加の影響下でも、予測フォロワー数はKloutなどの既存インフルエンス指標と比較してどの程度信頼性があるか?
- RQ5予測フォロワー数からの乖離を、購入フォロワーを持つユーザーを検出する信頼性の高いシグナルとして用いることができるか?
主な発見
- 表示フォロワー数から±100フォロワーの許容誤差を認めた場合、フォロワー数予測手法は84.2%の精度を達成する。
- 本手法は操作に対して高い耐性を示し、実際の顧客アカウントでは予測フォロワー数の変化が平均で0.10にとどまる一方、Kloutスコアは平均0.47上昇する。
- フリープレミアムブラックマーケットサービスで作成されたダミーアカウントでは、予測フォロワー数の変化が平均0.011にとどまり、Kloutスコアは平均0.32上昇する。
- 予測フォロワー数と表示フォロワー数の乖離が10%を超える閾値を用いることで、操作されたフォロワー数を持つユーザーを98.62%の精度で検出できる。
- 予測フォロワー数は操作に対しても安定している一方、Kloutのようなインフルエンス指標は人工的フォロワー増加に対して非常に感受性が強い。
- G1(≤1000フォロワー)、G2(1000~10,000フォロワー)、G3(≥10,000フォロワー)の各フォロワー数グループにわたり、本手法は一貫した性能を示し、ユーザーのスケールに依存しない有効性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。