Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Troll Behavior via Inverse Reinforcement Learning: A Case Study of Russian Trolls in the 2016 US Election

Luca Luceri, Silvia Giordano|arXiv (Cornell University)|Jan 28, 2020
Spam and Phishing Detection被引用数 18
ひとこと要約

本稿では、2016年米国大統領選挙期におけるロシアのトールアカウントを特定するため、オンライン行動の背後にあるインcentive(インcentive)を推定する逆強化学習(IRL)手法を提案する。この手法は、活動フローのデータのみを用いて、AUC 89.1% の分類性能を達成し、ユーザーのフィードバックとは独立したコンテンツ共有行動といった顕著な動機パターンを明らかにした。

ABSTRACT

Since the 2016 US Presidential election, social media abuse has been eliciting massive concern in the academic community and beyond. Preventing and limiting the malicious activity of users, such as trolls and bots, in their manipulation campaigns is of paramount importance for the integrity of democracy, public health, and more. However, the automated detection of troll accounts is an open challenge. In this work, we propose an approach based on Inverse Reinforcement Learning (IRL) to capture troll behavior and identify troll accounts. We employ IRL to infer a set of online incentives that may steer user behavior, which in turn highlights behavioral differences between troll and non-troll accounts, enabling their accurate classification. As a study case, we consider the troll accounts identified by the US Congress during the investigation of Russian meddling in the 2016 US Presidential election. We report promising results: the IRL-based approach is able to accurately detect troll accounts (AUC=89.1%). The differences in the predictive features between the two classes of accounts enables a principled understanding of the distinctive behaviors reflecting the incentives trolls and non-trolls respond to.

研究の動機と目的

  • 近年のボット検出技術の進展にもかかわらず、依然として同定が困難な人間が操作するトールアカウントの検出という未解決の課題に対処すること。
  • ユーザーの活動フローと相互作用の分析を通じて、トール行動の背後にあるインcentive(動機)をモデル化すること。
  • ラベル付き身元情報や外部メタデータに依存せず、観察可能なオンライン行動のみを用いて一般化可能で説明可能なトール分類手法を開発すること。
  • トールと通常ユーザーとの間の動機的差異を明らかにし、悪意あるインフォグラムキャンペーンの原理的検出を可能にすること。
  • IRLに基づく行動モデリングを用いて、政治的・健康的・社会的分野における国家支援トールの検出基盤を構築すること。

提案手法

  • 観察されたユーザー行動の背後にある報酬関数を推定するため、逆強化学習(IRL)を用い、特定の行動を引き起こす要因(インcentive)をモデル化する。
  • 推定された報酬構造を教師あり分類のための行動特徴として用い、トールアカウントと非トールアカウントを分類する。
  • オンライン行動の系列(例:リツイート、返信、いいね)を用いて、相互作用のダイナミクスとフィードバック感受性を捉えるためにIRLモデルを学習する。
  • 米国議会によってロシアのインターネット研究機関(IRA)関連と特定された2,752件のTwitterアカウントから構成されるデータセットにIRLフレームワークを適用する。
  • 推定された報酬を入力特徴として用い、バイナリ分類器に供給することで、トールと有機的ユーザー行動の区別を可能にする。
  • 特定された行動パターンを具体的なインcentive(動機)と結びつけることで、eXplainable AI(XAI)の原則に沿ったモデルの解釈可能性を確保する。

実験結果

リサーチクエスチョン

  • RQ1逆強化学習(IRL)は、ソーシャルメディア上でのトール行動の背後にある隠れたインcentive(動機)を効果的に解明できるか?
  • RQ2トールアカウントの推定された動機構造は、通常ユーザーとはどのように異なるか?
  • RQ3IRLに基づく行動特徴は、活動フローのデータのみを用いて、国家支援トールアカウントを高い正確性で分類できるか?
  • RQ4通常ユーザーと比較して、トールはどの程度、社会的フィードバック(例:いいね、リツイート)に反応するか?
  • RQ5IRLベースのアプローチは、異なるプラットフォームや種々の悪意あるオンライン行動に一般化可能か?

主な発見

  • IRLベースの手法は、活動フローのデータのみを用いて、AUC 89.1% の性能を達成し、ロシアのトールアカウントと非トールアカウントを区別した。
  • トールアカウントは、ユーザーのフィードバック(リツイートやいいねなど)とはほとんど関係なく行動しており、エンゲージメントよりもコンテンツ配信に注力していることが示された。
  • トールは相互作用の結果に関係なく一貫してコンテンツを共有する傾向を示しており、戦略的でインcentive(動機)に基づいた配信モデルであることが示唆された。
  • 推定された報酬関数は、特に社会的フィードバックや相互作用ダイナミクスへの反応において、トールと通常ユーザーとの間で顕著な行動的差異を明らかにした。
  • クリックストリームベースのモデルは、トールと通常ユーザーを区別できず、従来の行動クラスタリング手法の限界を浮き彫りにした。
  • IRLモデルは、背後にある動機を解明することで、解釈可能で一般化可能な悪意あるアカウント検出フレームワークを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。