Skip to main content
QUICK REVIEW

[論文レビュー] Botnet Campaign Detection on Twitter

Jeremy Fields|arXiv (Cornell University)|Aug 29, 2018
Spam and Phishing Detection参考文献 2被引用数 4
ひとこと要約

本稿では、時系列的類似性と隣接ツイート間の属性の一貫性を分析することで、リアルタイムで軽量な方法でTwitter上のボットネットキャンペーンを検出する手法を提案する。920,008件のツイートから14,585体のボットを検出するが、高速かつ計算コストが低く、従来の機械学習やネットワーク解析手法に比べて、一括されたスパムキャンペーンにおける即時性とスケーラビリティに優れる。

ABSTRACT

This is an approach to detecting a subset of bots on Twitter, that at best is under-researched. This approach will be generic enough to be adaptable to most, if not all social networks. The subset of bots this focuses on are those that can evade most, if not all current detection methods. This is simply because they have little to no information associated with them that can be analyzed to make a determination. Although any account on any social media site inherently has information associated with it, it is very easy to blend in with the majority of users who are simply "lurkers" - those who only consume content, but do not contribute. How can you determine if an account is a bot if they don't do anything? By the time they act, it will be too late to detect. The only solution would be a real time, or near real-time, detection algorithm.

研究の動機と目的

  • 従来の検出手法が回避する、非活動状態にあったり人間の「うかがい」を模倣するなどして、活動を隠す協調的ボットネットキャンペーンを検出する課題に対処すること。
  • 履歴データ、ネットワーク解析、複雑な機械学習モデルに依存しない、リアルタイムの検出システムを構築すること。
  • ツイートの属性をその直近N件の時系列的近傍ツイートと比較することで、行動的および文面的一致性に注目し、ボットネットを特定すること。
  • 高スループットのソーシャルメディアストリームに適した、スケーラブルで計算コストが低い検出を可能にすること。
  • 反応型検出戦略の遅延を克服し、ボットが行動する前に対象を検出できる方法を提供すること。

提案手法

  • 本手法は、各ツイートの属性を時系列的に直近N件のツイートと比較することで、リアルタイム分析を実行する。スライディングウィンドウをN件のツイートに設定する。
  • テキスト類似度、言語、ユーザーエージェント、場所、プロフィールURL、感情など12の属性について、各属性ごとに0〜Nのスケールでスコアを算出する。
  • 全属性にわたる合成スコアを計算し、論理的でない属性にはしきい値を適用する(例:テキスト類似度のしきい値は0.6に設定)。
  • 合成スコアが最大スコアの事前に定義された割合を超える場合、ボットと分類する。
  • 本手法は、アカウント履歴やネットワーク構造、複雑なモデルに依存せず、局所的な時系列的一致性に焦点を当てる。
  • 設定可能なスコアリングシステムを採用し、乗数としきい値を用いることで、異なるデータソースや検出目的に適応可能である。

実験結果

リサーチクエスチョン

  • RQ1履歴データやネットワーク解析に依存せず、軽量でリアルタイムな手法が、Twitter上での協調的ボットネットキャンペーンを検出できるか。
  • RQ2隣接するツイート間の時系列的属性的一致性は、ボット活動の特定にどの程度有効か。
  • RQ3単純な比較ベースのシステムが、低活動で巧妙なボットネットを検出する際、複雑な機械学習モデルを上回れるか。
  • RQ4属性類似度の最適なしきい値と乗数は何か。これによりボットネットキャンペーンの検出精度が最大限に高まるか。
  • RQ5本手法は、TwitterのFirehoseのような高スループットデータストリームにどの程度スケーラブルに適用できるか。

主な発見

  • 920,008件のツイートから14,585体のボットアカウントを検出。そのうち10,998体は独自のアカウントであり、高い検出カバレッジを示した。
  • 検出された2,586体のボットアカウントのうち、2,586体がTwitterによって一括して停止または削除された。これにより、本システムの正確性と現実世界での関連性が裏付けられた。
  • システムはデータ収集速度の5倍以上で処理を実行し、920,008件のツイートをわずか5時間45分で処理した。
  • スライディングウィンドウ内の20件中17件のツイートが高類似度(スコア>0.6)を示した場合にボット活動の強い兆候が観察された。これは一括されたメッセージ送信を示唆している。
  • 場所やタイムゾーンデータが不一致または欠落していても、一貫したプロフィールURL、説明文、ユーザーエージェントがボットネットの特定に寄与した。
  • 本手法は最小限の計算コストで高いパフォーマンスを達成した。Pythonを用いた1台の一般消費者向けマシンで実行可能であり、最適化や分散処理を施せばさらにスケーリング可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。