Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Machine Learning of Open Source Russian Twitter Data Reveals Global Scope and Operational Characteristics

Christopher Griffin, Brady Bickel|arXiv (Cornell University)|Oct 2, 2018
Opinion Dynamics and Social Influence参考文献 16被引用数 5
ひとこと要約

本稿では、非教師付き機械学習を用いて、オープンソースのロシア語ツイッターデータを分析し、疑惑のインフルエンスキャンペーンにおける隠れた運用パターンを解明する。自然言語処理(NLP)、多様体学習、フーリエ解析を用いて、米国、フランス、ドイツの選挙にまたがる国際的活動を特定。英語以外の言語コミュニティ(ドイツ語とロシア語のクラスタ)を同定し、こうした運用が複数の民主主義国にわたり一貫性があり識別可能な行動的特徴を示すことを示した。

ABSTRACT

We developed and used a collection of statistical methods (unsupervised machine learning) to extract relevant information from a Twitter supplied data set consisting of alleged Russian trolls who (allegedly) attempted to influence the 2016 US Presidential election. These unsupervised statistical methods allow fast identification of (i) emergent language communities within the troll population, (ii) the transnational scope of the operation and (iii) operational characteristics of trolls that can be used for future identification. Using natural language processing, manifold learning and Fourier analysis, we identify an operation that includes not only the 2016 US election, but also the French National and both local and national German elections. We show the resulting troll population is composed of users with common, but clearly customized, behavioral characteristics.

研究の動機と目的

  • 非教師付き機械学習を用いて、ツイッター上での疑惑のロシア影響キャンペーンの世界的なスコープと運用的特徴を調査すること。
  • 事前のラベル付けや学習データなしに、トールトールの集団内における顕在する言語コミュニティを同定すること。
  • 複数の国における主要な政治的出来事に関連する、ツイート活動における国際的パターンを同定すること。
  • 時間的活動のピークや言語的クラスタリングといった、将来の類似インフルエンスキャンペーンの検出を可能にする「運用の指紋」を抽出すること。
  • オープンソースのツイッターデータと統計的手法を用いて、調整された誤情報キャンペーンを解明する可能性を評価すること。

提案手法

  • ツイート内容に基づくクラスタリングのため、動的ストップワードを除外してトピック的コミュニティを特定する非教師付き自然言語処理を適用。
  • 時間的ツイート時系列のフーリエ解析を実施し、パワースペクトルを計算。これにより、ユーザーの投稿行動の比較が可能になった。
  • パワースペクトル間のコサイン類似度を計算し、グラフベースのクラスタリングに用いる重み付き隣接行列を構築。
  • 得られたグラフに対して最大モジュラリティクラスタリングを適用し、行動的類似性に基づくユーザーコミュニティを同定。
  • 次元削減のための多様体学習を用い、高次元のツイートおよび活動データの背後にある構造を明らかにした。
  • ワードクラウドと正規化されたテキスト解析を用い、支配的テーマ(ドイツ語およびロシア語の非英語コンテンツを含む)を可視化した。

実験結果

リサーチクエスチョン

  • RQ1疑惑のロシアトールオペレーションが標的とした国際的政治的出来事は何か。また、活動パターンはこうした出来事とどのように相関していたか。
  • RQ2トールトール集団内に顕在した言語コミュニティは何か。これらは異なるテーマ的・言語的焦点を反映しているか。
  • RQ3非教師付き機械学習は、異なる国や選挙においてもトール活動に一貫性のある行動的特徴を検出できるか。
  • RQ4ツイート数の時間的パターンは、主要な政治的党大会や出来事の時期に合わせた戦略的タイミングをどのように示しているか。
  • RQ5ドイツ語やロシア語などの非英語クラスタが、協調的で国境を越えたインフルエンスキャンペーンを示唆する程度はどの程度か。

主な発見

  • トールオペレーションは、2016年共和党大会(RNC)の前および2017年5月9日、ジェイムズ・コビー氏の解任の前後に明確な活動ピークを示す、構造的かつ反応的な行動を示した。
  • 11のユーザーコミュニティが同定され、そのうち7つは主要なトピッククラスタとして:米国茶党運動、アフリカ系アメリカン関連問題、クリーブランド/オハイオ地方関連、およびドイツ語・ロシア語の非英語クラスタが含まれた。
  • ドイツ語クラスタは2016年および2017年のドイツ選挙中に活動しており、2016年のコンテンツには「#merkelmussbleiben」のハッシュタグが含まれ、ボット生成の可能性があり、皮肉または支持的意図である可能性も示唆された。
  • 2017年のドイツ選挙のコンテンツはより一般的で、より深い分析のための正規化やストップワードフィルタリングの改善が求められた。
  • フランス選挙のワードクラウドでは弱い信号が観察され、マクロン氏のみが顕著なトピックとして現れた。これは、データ品質や信号強度に限界がある可能性を示唆した。
  • ロシア語およびドイツ語クラスタとも、中心的なユーザーが周辺ユーザーに影響を与えるという、階層的運用構造を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。