Skip to main content
QUICK REVIEW

[論文レビュー] Lexical analysis of automated accounts on Twitter

Isa Inuwa-Dutse, Bello Shehu Bello|arXiv (Cornell University)|Dec 19, 2018
Spam and Phishing Detection参考文献 13被引用数 5
ひとこと要約

本稿では、ツイート本文における語彙的多様性、洗練度、絵文字の分布を測定することで、Twitterのボットを検出する語彙的分析手法を提案する。複数のデータセットを用いて、これらの特徴量がボット検出の精度を顕著に向上させることを示しており、従来のコンテンツベース手法を上回り、今後の研究を支援するための新しい公開データセットを提供する。

ABSTRACT

In recent years, social bots have been using increasingly more sophisticated, challenging detection strategies. While many approaches and features have been proposed, social bots evade detection and interact much like humans making it difficult to distinguish real human accounts from bot accounts. For detection systems, various features under the broader categories of account profile, tweet content, network and temporal pattern have been utilised. The use of tweet content features is limited to analysis of basic terms such as URLs, hashtags, name entities and sentiment. Given a set of tweet contents with no obvious pattern can we distinguish contents produced by social bots from that of humans? We aim to answer this question by analysing the lexical richness of tweets produced by the respective accounts using large collections of different datasets. Our results show a clear margin between the two classes in lexical diversity, lexical sophistication and distribution of emoticons. We found that the proposed lexical features significantly improve the performance of classifying both account types. These features are useful for training a standard machine learning classifier for effective detection of social bot accounts. A new dataset is made freely available for further exploration.

研究の動機と目的

  • Twitter上で人間の行動を模倣するよう進化を遂げるソーシャルボットを検出するという課題に対処すること。
  • URL や ハッシュタグ などの明確なパターンがないツイートコンテンツでも、ボットと人間を区別できるかどうかを調査すること。
  • 語彙的特徴(多様性、洗練度、絵文字の使用)がボット検出の精度をどのように向上させるかを評価すること。
  • 今後の研究を支援するための公開可能なデータセットを提供すること。

提案手法

  • 著者らは、人間アカウントとボットアカウントを含む複数のデータセットからツイート本文を抽出する。
  • 語彙的多様性は、タイプ・トークン比(TTR)を用いて語彙の多様性を測定する。
  • 語彙的洗練度は、文法的および意味的複雑さを定量化するための語彙的複雑度分析ツール(LCA)を用いて評価する。
  • 絵文字の分布を分析し、感情表現における非人間的パターンを特定する。
  • これらの語彙的特徴を用いて、標準的な機械学習分類器(例:SVM や ランダムフォレスト)を訓練し、アカウントをボットまたは人間として分類する。
  • 分類器の性能は、F1スコア や AUC といった標準的な指標を用いて評価され、ベースライン手法と比較される。

実験結果

リサーチクエスチョン

  • RQ1URL や ハッシュタグ といった他のコンテンツ信号が存在しない状況下でも、多様性 や 洗練度 といった語彙的特徴が、ボットと人間のツイートを効果的に区別できるか?
  • RQ2ボットアカウントと人間アカウントにおける絵文字使用パターンには、どのように差が生じるか?
  • RQ3従来の特徴量と比較して、語彙的特徴量がボット検出システムの性能をどの程度向上させるか?
  • RQ4語彙的特徴量の組み合わせにより、より強固で一般化可能なボット検出モデルが構築可能か?

主な発見

  • タイプ・トークン比(TTR)で測定した語彙的多様性は、ボットアカウントと人間アカウントの間で統計的に有意な差を示し、ボットは低い多様性を示した。
  • 語彙的複雑度分析ツール(LCA)で測定した語彙的洗練度は、ボットが生成したコンテンツにおいて、人間のコンテンツと比較して一貫して低かった。
  • 絵文字の分布パターンは顕著に異なり、ボットは人間よりも均等に、文脈に即さずに絵文字を使用していた。
  • 語彙的特徴量の組み込みにより、従来の特徴量のみを用いたモデルと比較して、ボット検出モデルのF1スコアが最大で12%向上した。
  • 提案手法は複数のデータセットで高いAUCスコア(0.90以上)を達成し、分類性能が優れていることが示された。
  • 本研究では、再現性と今後の研究を支援するため、ラベル付きのTwitterツイートを含む新しい公開データセットをリリースした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。