Skip to main content
QUICK REVIEW

[論文レビュー] Twitter Bot Detection Using Bidirectional Long Short-term Memory Neural Networks and Word Embeddings

Wei Feng, Uyen Trang Nguyen|arXiv (Cornell University)|Feb 3, 2020
Spam and Phishing Detection参考文献 54被引用数 18
ひとこと要約

本稿では、ユーザープロフィール、フレンドシップネットワーク、手作業で設計された特徴量に依存せずに、ツイート本文のみを用いてTwitterのボットを検出する、単語埋め込みを組み込んだ双方向LSTM(BiLSTM)ニューラルネットワークを提案する。このモデルは、cresci-2017データセットにおいて最先端の性能を達成し、生のテキスト系列からのエンド・ツー・エンド学習によって、人間アカウントとスパムボットを区別する際、96.1%の高精度(96.1%)とF-measure(96.3%)を達成した。

ABSTRACT

Twitter is a web application playing dual roles of online social networking and micro-blogging. The popularity and open structure of Twitter have attracted a large number of automated programs, known as bots. Legitimate bots generate a large amount of benign contextual content, i.e., tweets delivering news and updating feeds, while malicious bots spread spam or malicious contents. To assist human users in identifying who they are interacting with, this paper focuses on the classification of human and spambot accounts on Twitter, by employing recurrent neural networks, specifically bidirectional Long Short-term Memory (BiLSTM), to efficiently capture features across tweets. To the best of our knowledge, our work is the first that develops a recurrent neural model with word embeddings to distinguish Twitter bots from human accounts, that requires no prior knowledge or assumption about users' profiles, friendship networks, or historical behavior on the target account. Moreover, our model does not require any handcrafted features. The preliminary simulation results are very encouraging. Experiments on the cresci-2017 dataset show that our approach can achieve competitive performance compared with existing state-of-the-art bot detection systems.

研究の動機と目的

  • ユーザープロフィール、フレンドシップネットワーク、歴史的行動に関する事前知識を一切必要としないボット検出システムの開発を目的とする。
  • ボット検出における人的作業に依存する特徴量の手作業設計を排除し、ディープラーニングを活用することを目的とする。
  • 再帰的ニューラルネットワークと単語埋め込みを用いた、ツイートアカウントを人間かスパムボットかに分類する有効性を評価することを目的とする。
  • 実世界の応用において、より迅速かつ効率的なボット検出システムの展開を可能にする。

提案手法

  • ツイート系列における過去および未来の単語からの文脈的依存関係を捉えるために、双方向LSTM(BiLSTM)ネットワークを採用する。
  • 従来の自然言語処理における特徴量設計に代わる、事前学習済みの単語埋め込みを用いて、生のテキストツイートを密なベクトル表現に変換する。
  • メタデータやネットワーク構造を一切使用せず、ツイート本文のみを用いてBiLSTMモデルをエンド・ツー・エンドで学習する。
  • 正則化と最終的な分類(人間またはボット)のため、ドロップアウトおよびソフトマックス層を適用する。
  • cresci-2017データセットでの効率的な学習のため、Adam最適化手法とカテゴリカル交差エントロピー損失関数を用いる。
  • 学習済みモデルを用いて、順序付けられた言語的パターンに基づき、テストツイートを分類する推論を実行する。

実験結果

リサーチクエスチョン

  • RQ1単語埋め込みを用いたBiLSTMモデルは、ユーザープロフィールやネットワーク構造を一切使わず、ツイート本文のみを用いて人間アカウントとスパムボットを効果的に区別できるか?
  • RQ2特徴量設計なしのディープラーニングアプローチの性能は、Twitterボット検出分野における最先端手法と比較してどのように差がつくか?
  • RQ3文脈的な系列モデリングは、ボットが生成するツイートに特徴的な言語的パターンをどの程度捉えることができるか?
  • RQ4プロフィール、ネットワーク、行動履歴の特徴量が欠落している場合、検出精度に顕著な影響が及ぶか?

主な発見

  • 提案されたBiLSTMモデルは、cresci-2017データセットのテストセット#1で96.1%の精度と96.3%のF-measureを達成し、複数の既存手法を上回った。
  • テストセット#2では92.9%の精度と92.6%のF-measureを達成し、異なるデータ分割にわたる強力な汎化性能を示した。
  • テストセット#1では94.0%の精度と97.6%のリコールを達成し、スパムボットの特定に高い信頼性を示した。
  • ワードクラウド分析から、ボットは「awesome」や「fascinating」のような誇張されたプロモーション用語を頻繁に使用し、人間アカウントよりも外部リンクを多く含む傾向があることが明らかになった。
  • 特徴量設計を一切行わず、BotOrNot? や C. Yang et al. などの教師ありベースライン手法よりもF-measureおよびMCCで顕著に優れた性能を示した。
  • 結果から、単語埋め込みを用いたディープラーニングが、ツイート内の言語的パターンを効果的にモデル化でき、補助データなしで高精度なボット検出を実現できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。