Skip to main content
QUICK REVIEW

[論文レビュー] On-the-fly Detection of Autogenerated Tweets

Jonas Lundberg, Jonas Nordqvist|arXiv (Cornell University)|Feb 4, 2018
Spam and Phishing Detection参考文献 23被引用数 3
ひとこと要約

本稿では、リアルタイムのTwitterストリームにおいて、ユーザーのプロファイルデータを含まない(no-Profile Classifier)か、含む(Profile Classifier)tweetのテキストおよびメタデータを用いて、即時的に生成されたツイート(AGT)を検出する二段階分類器システムを提示する。この手法はAGT検出で98%の正確性を達成しており、Profile Classifierはより単純なno-Profile Classifierに比べてわずかな性能向上を示しており、一部の状況ではユーザーのタイムラインデータのダウンロードを回避することで遅延を低減できる可能性を示唆している。

ABSTRACT

Most previous work related to tweet classification have focused on identifying a given tweet as a spam, or to classify a Twitter user account as a spammer or a bot. In most cases the tweet classification has taken place offline, on a pre-collected dataset of tweets. In this paper we present an \emph{on-the-fly} approach to classify each newly downloaded tweet as \emph{autogenerated} or not. We define an autogenerated tweet (AGT) as a tweet where all or parts of the natural language content is generated automatically by a bot or other type of program. Our on-the-fly approach makes use of two classifiers. The first classifies a tweet solely based on the twitter text and the tweet metadata that comes with every tweet. It is used for tweets posted by unknown users with no available tweet history. An unknown user also triggers a batch job to start downloading the missing user timeline information. The second classifier is used for tweets posted by a user where the user timeline is downloaded and available. Initially, it will be the first classifier that handles most of the tweets. This will gradually change and after an initialization phase where we download historic data for the most active users, we reach a state where the second classifier handles a vast majority of all the tweets. A simulation using our on-the-fly detection mechanism indicates that we can handle Twitter streams with up to 68,000 unique users each day. The bottleneck is the time required to download new user timelines. The AGT detection is very accurate. In a set of 5,000 tweets we correctly classified about 98\% of all AGTs using a subject-wise cross-validation.

研究の動機と目的

  • Twitterストリームにおけるボットや自動化プログラムが生成するツイート(自動生成ツイート、AGT)を、リアルタイムで即時的に検出するためのシステムを開発すること。
  • 過去のユーザーのデータ(例:ユーザーのタイムライン)が必要であるが、リアルタイムでは取得に時間がかかるという課題に対処すること。
  • ユーザーのタイムラインデータをダウンロードする必要がない、単純な分類器(テキストとメタデータのみ)が、より複雑なタイムラインデータを含む分類器と同等の性能を示すかどうかを評価すること。
  • 高スループットのTwitterストリーム処理におけるシステムスケーラビリティをシミュレートし、性能ボトルネックを同定すること。

提案手法

  • 二段階分類器アーキテクチャを提案:新規ユーザー向けには、リアルタイムのツイートテキストおよびメタデータのみを用いる「no-Profile Classifier」と、既知のユーザーに対してはダウンロード済みのユーザーのタイムラインデータを用いる「Profile Classifier」を採用する。
  • no-Profile Classifierは、テキスト特徴量(例:エントロピー、繰り返し、URL密度)およびメタデータ(例:デバイスタイプ、リツイート比)を用いてAGTを検出する。
  • Profile Classifierは、ユーザーのタイムラインを用いてχ²検定によるツイートの周期性と時間的エントロピーを計算することで、検出性能を向上させる。
  • NTSデータを59日分使用したシミュレーションにより、システムの性能(スループット、分類器のワークロード分布など)を推定する。
  • SVM、ランダムフォレスト、ナイーブベイズの3つの機械学習モデルを、手動ラベル付けされた10,000件のツイート(うち2,251件がAGT)のデータセット上で学習・評価する。
  • 異なるユーザーおよびツイートソース間での一般化性能を評価するために、ユーザー単位の交差検証を実施する。

実験結果

リサーチクエスチョン

  • RQ1ユーザーのタイムラインデータにアクセスしないで、ツイートのテキストとメタデータのみを用いて、軽量かつリアルタイムな分類器がAGTを検出できるか?
  • RQ2ユーザーのタイムラインデータを組み込むことで、メタデータのみの分類に比べてAGT検出の正確性が顕著に向上するか?
  • RQ3この即時検出システムが処理可能なTwitterストリームの最大規模(1日あたりのユニークユーザー数)はどの程度か?
  • RQ4手動ラベル付けされた10,000件のツイートデータセット上で学習された異なる機械学習モデルは、AGT分類においてどの程度の性能を示すか?
  • RQ5分類器の主な失敗モードは何か? また、モデルの最適化や特徴量の重み付けを改善することで、これらの失敗を緩和できるか?

主な発見

  • no-Profile ClassifierはAGT検出で97.9%の正確性を達成しており、より複雑なProfile Classifierに比べて24件の誤分類が追加にとどまっている。
  • Profile Classifierは98.0%の正確性を達成したが、no-Profile Classifierに比べてわずかな向上にとどまり、このデータセットではユーザーのタイムラインデータのダウンロードがAGT検出に必須でない可能性を示唆している。
  • テキスト分類器のみでもAGT検出で96.3%の正確性を達成しており、テキスト的および構造的特徴量のみで強力な性能を示していることが判明した。
  • システムは1日あたり最大68,000件のユニークユーザーを処理可能であり、ユーザーのタイムラインダウンロード時間こそ主な性能ボトルネックである。
  • 誤分類されたツイートの多くは、レアなアプリを使用した人間のユーザーが生成したものであり、テキスト分類器のAGT確率スコアは低かったが、他の指標は自動化を示唆していた。
  • 本研究では、テキスト分類器の影響力について継続的な学習と微調整を行うことで、進化するAGT生成手法に対する耐性を高められると示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。