Skip to main content
QUICK REVIEW

[논문 리뷰] Spider and the Flies : Focused Crawling on Tumblr to Detect Hate Promoting Communities

Swati Agarwal, Ashish Sureka|arXiv (Cornell University)|2016. 03. 30.
Spam and Phishing Detection참고 문헌 17인용 수 8
한 줄 요약

이 논문은 텍스트 분류와 사회적 네트워크 분석을 활용해 툴버그(Tumblr)에서 혐오를 조장하는 커뮤니티를 탐지하는 주제 기반 크롤러를 제안한다. 혐오 콘텐츠 블로그를 기반으로 일종의 분류기 모델을 학습하고, 재블로깅(re-blogs)과 좋아요를 네트워크 링크로 간주하며 중심성 측정법을 적용함으로써, F-스코어 0.80을 달성하고 재블로깅 패턴을 통해 영향력 있는 극단주의자들을 특정한다. 이는 재블로깅이 극단주의자 네트워크의 연결성을 강력하게 나타내는 지표임을 보여준다.

ABSTRACT

Tumblr is one of the largest and most popular microblogging website on the Internet. Studies shows that due to high reachability among viewers, low publication barriers and social networking connectivity, microblogging websites are being misused as a platform to post hateful speech and recruiting new members by existing extremist groups. Manual identification of such posts and communities is overwhelmingly impractical due to large amount of posts and blogs being published every day. We propose a topic based web crawler primarily consisting of multiple phases: training a text classifier model consisting examples of only hate promoting users, extracting posts of an unknown tumblr micro-blogger, classifying hate promoting bloggers based on their activity feeds, crawling through the external links to other bloggers and performing a social network analysis on connected extremist bloggers. To investigate the effectiveness of our approach, we conduct experiments on large real world dataset. Experimental results reveals that the proposed approach is an effective method and has an F-score of 0.80. We apply social network analysis based techniques and identify influential and core bloggers in a community.

연구 동기 및 목표

  • 주제 기반 웹 크롤러를 사용해 툴버그에서 혐오를 조장하는 블로거를 탐지하는 것.
  • 재블로깅과 좋아요를 네트워크 링크로 활용할 때, 극단주의 커뮤니티를 드러내는 데에 얼마나 효과적인지 평가하는 것.
  • 사회적 네트워크 분석을 적용해 극단주의 네트워크 내에서 중심적이고 영향력 있는 블로거를 식별하는 것.
  • 게시물 내용, 태그, 캡션과 같은 맥락적 메타데이터가 혐오를 조장하는 콘텐츠를 분류하는 데 어떤 기여를 하는지 조사하는 것.
  • 마이크로블로깅 플랫폼에서 숨겨진 극단주의 커뮤니티를 자동으로 탐지할 수 있는 가능성을 입증하는 것.

제안 방법

  • 기존에 알려진 혐오를 조장하는 블로거들의 게시물만을 사용해 일종의 분류기 모델을 학습하여 유사한 사용자를 식별하는 것.
  • 노드가 툴버그 블로거이고, 간선이 재블로깅 또는 좋아요를 나타내는 방향성 있는 그래프에서 무작위 보행을 수행하는 것.
  • 분류를 위해 블로거의 활동 피드에서 게시물과 메타데이터(내용, 태그, 캡션)를 추출하는 것.
  • 재블로깅된 게시물 기반과 좋아요를 받은 게시물 기반으로 별도의 두 개의 네트워크를 구축하여 링크의 효과성을 비교하는 것.
  • 중심성 측정법(근접도 중심성, 중간 중심성, 진입도/출구도)을 적용해 영향력 있는 블로거와 핵심 블로거를 식별하는 것.
  • 모듈래리티와 군집 계수를 사용해 네트워크 구조와 커뮤니티 형성 여부를 평가하는 것.

실험 결과

연구 질문

  • RQ1콘텐츠와 링크 기반 특징을 활용할 때, 주제 기반 크롤러가 툴버그에서 혐오를 조장하는 블로거를 효과적으로 식별할 수 있는가?
  • RQ2재블로깅과 '좋아요' 행동은 극단주의 블로거 간의 연결성을 나타내는 데 얼마나 효과적인가?
  • RQ3사회적 네트워크 분석을 통해 툴버그에서 숨겨진 혐오를 조장하는 사용자 커뮤니티를 얼마나 잘 드러낼 수 있는가?
  • RQ4게시물 내용, 태그, 캡션과 같은 맥락적 메타데이터는 어떻게 극단주의 콘텐츠 분류에 기여하는가?
  • RQ5툴버그의 극단주의 네트워크에서 영향력 있고 핵심적인 블로거를 식별하는 데 가장 적합한 중심성 측정법은 무엇인가?

주요 결과

  • 제안된 방법은 혐오를 조장하는 블로거 탐지에서 F-스코어 0.80을 달성하여 높은 효과성을 입증한다.
  • 재블로깅은 '좋아요'보다 더 강력하고 구분력 있는 링크 특징으로, 연결된 극단주의 커뮤니티를 식별하는 데 유의미하다.
  • 재블로깅 링크 기반 네트워크는 더 높은 조밀도와 모듈래리티를 보이며, 더 강력한 커뮤니티 구조를 나타낸다.
  • 높은 중간 중심성(Median betweenness centrality)을 가진 블로거들은 극단주의 네트워크의 핵심이 되어 서로 분리된 노드들을 연결하는 다리 역할을 한다.
  • 근접도 중심성(Closeness centrality)은 핵심에서 2~3단계 떨어진 곳에 위치한 핵심 영향력자를 식별하며, 네트워크의 광범위한 영향력을 시사한다.
  • 수동 검토 결과, 혐오 게시물은 매우 인기가 많고, 많은 수의 노트를 받으며, 특정 청중을 정확히 타겟으로 삼고 있음이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.