Skip to main content
QUICK REVIEW

[論文レビュー] Spider and the Flies : Focused Crawling on Tumblr to Detect Hate Promoting Communities

Swati Agarwal, Ashish Sureka|arXiv (Cornell University)|Mar 30, 2016
Spam and Phishing Detection参考文献 17被引用数 8
ひとこと要約

本稿では、テキスト分類とソーシャルネットワーク分析を用いてTumblr上のが嫌いを助長するコミュニティを特定するトピッククラッターを提案する。嫌いを助長するコンテンツを含むブログのデータを用いて1クラス分類器を学習し、リブログや「いいね」をネットワークのリンクとして扱い、中心性測度を適用することで、Fスコア0.80を達成した。また、リブログのパターンから影響力を持つ過激派を同定し、リブログが過激派ネットワークの接続性を示す強力な指標であることが示された。

ABSTRACT

Tumblr is one of the largest and most popular microblogging website on the Internet. Studies shows that due to high reachability among viewers, low publication barriers and social networking connectivity, microblogging websites are being misused as a platform to post hateful speech and recruiting new members by existing extremist groups. Manual identification of such posts and communities is overwhelmingly impractical due to large amount of posts and blogs being published every day. We propose a topic based web crawler primarily consisting of multiple phases: training a text classifier model consisting examples of only hate promoting users, extracting posts of an unknown tumblr micro-blogger, classifying hate promoting bloggers based on their activity feeds, crawling through the external links to other bloggers and performing a social network analysis on connected extremist bloggers. To investigate the effectiveness of our approach, we conduct experiments on large real world dataset. Experimental results reveals that the proposed approach is an effective method and has an F-score of 0.80. We apply social network analysis based techniques and identify influential and core bloggers in a community.

研究の動機と目的

  • トピックベースのウェブクローラーを用いてTumblr上のが嫌いを助長するブロガーを特定すること。
  • リブログと「いいね」をネットワークリンクとして用いる際の有効性が、過激派コミュニティの特定にどの程度寄与するかを評価すること。
  • ソーシャルネットワーク分析を適用し、過激派ネットワーク内の中心的かつ影響力のあるブロガーを同定すること。
  • 投稿内容、タグ、キャプションなどの文脈的メタデータが、嫌いを助長するコンテンツの分類にどのように寄与するかを調査すること。
  • マイクロブログプラットフォーム上での隠れた過激派コミュニティの自動検出の可能性を示すこと。

提案手法

  • 既知のが嫌いを助長するブロガーの投稿のみを用いて1クラス分類器を学習し、類似するユーザーを特定する。
  • ノードがTumblrのブロガー、エッジがリブログや「いいね」を表す有向グラフ上でランダムウォークを実行する。
  • 分類のため、ブロガーのアクティビティフィードから投稿およびメタデータ(内容、タグ、キャプション)を抽出する。
  • 「リブログされた投稿」に基づくネットワークと「いいねされた投稿」に基づくネットワークを別々に構築し、リンクの有効性を比較する。
  • 中心性測度(近接性、媒介性、インデグリー/アウトディグリー)を適用して、影響力のあるおよびコアなブロガーを同定する。
  • モジュラリティとクラスタリング係数を用いて、ネットワーク構造およびコミュニティ形成の評価を行う。

実験結果

リサーチクエスチョン

  • RQ1コンテンツおよびリンクベースの特徴を用いて、トピッククラッターがTumblr上のが嫌いを助長するブロガーを効果的に特定できるか?
  • RQ2リブログと「いいね」の行動は、過激派ブロガー間の接続を示す指標としてどの程度有効か?
  • RQ3どの程度までソーシャルネットワーク分析が、Tumblr上のが嫌いを助長するユーザーの隠れたコミュニティを解明できるか?
  • RQ4投稿内容、タグ、キャプションなどの文脈的メタデータは、過激派コンテンツの分類にどのように寄与するか?
  • RQ5Tumblr上のが嫌いを助長するネットワークにおいて、どの中心性測度が影響力のあるおよびコアなブロガーを最も適切に同定できるか?

主な発見

  • 提案手法は、嫌いを助長するブロガーを同定する際、Fスコア0.80を達成し、高い有効性を示した。
  • リブログは「いいね」よりも強く、より特徴的なリンク特徴であり、接続された過激派コミュニティを特定するのに優れている。
  • リブログリンクに基づくネットワークは、密度とモジュラリティが高く、より明確なコミュニティ構造を示している。
  • 高い媒介性中心性を示すブロガーは、他のノードとは接続されていない過激派ネットワークの間をつなぐブリッジとして機能している。
  • 近接性中心性は、コアから2〜3ホップの距離に位置する主要なインフルエンサーを同定しており、広範なネットワーク的影響を示している。
  • 手動による検証により、嫌いを助長する投稿は非常に人気が高く、多数の「いいね」を獲得しており、特定の対象層を的確に標的にしていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。