Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Machine Learning of Open Source Russian Twitter Data Reveals Global Scope and Operational Characteristics

Christopher Griffin, Brady Bickel|arXiv (Cornell University)|2018. 10. 02.
Opinion Dynamics and Social Influence참고 문헌 16인용 수 5
한 줄 요약

이 논문은 비감독 기계학습을 활용해 오픈소스 러시아 티터 데이터를 분석하여, 의심스러운 영향 작전의 숨겨진 운영 패턴을 규명한다. 자연어 처리, 다양체 학습, 푸리에 분석을 통해 미국, 프랑스, 독일 선거에 걸쳐 다국적 활동을 식별하며, 영어 외의 클러스터가 포함된 언어 공동체—특히 독일어 및 러시아어 공동체—를 규명함으로써 이러한 작전이 여러 민주주의 국가에서 일관되고 식별 가능한 행동 서명을 보임을 입증한다.

ABSTRACT

We developed and used a collection of statistical methods (unsupervised machine learning) to extract relevant information from a Twitter supplied data set consisting of alleged Russian trolls who (allegedly) attempted to influence the 2016 US Presidential election. These unsupervised statistical methods allow fast identification of (i) emergent language communities within the troll population, (ii) the transnational scope of the operation and (iii) operational characteristics of trolls that can be used for future identification. Using natural language processing, manifold learning and Fourier analysis, we identify an operation that includes not only the 2016 US election, but also the French National and both local and national German elections. We show the resulting troll population is composed of users with common, but clearly customized, behavioral characteristics.

연구 동기 및 목표

  • 비감독 기계학습을 활용해 티터에서 의심스러운 러시아 영향 작전의 글로벌 범위와 운영 특성을 탐색한다.
  • 사전 레이블링이나 학습 데이터 없이 트롤 인구 내에서 나타나는 언어 공동체를 탐지한다.
  • 다양한 국가에서의 주요 정치적 사건과 관련된 트윗 활동 패턴에서 다국적 패턴을 식별한다.
  • 시간적 활동 급증과 언어적 군집화와 같은 운영 지문(예: 일정 패턴, 언어적 특성)을 추출하여 향후 유사한 영향 작전의 탐지 가능성을 높인다.
  • 오픈소스 티터 데이터와 통계적 방법을 활용해 조정된 가짜 정보 캠페인을 규명할 수 있는지의 가능성을 평가한다.

제안 방법

  • 트윗 내용 기반으로 사용자 군집화를 위해 비감독 자연어 처리를 적용하며, 주제 공동체를 식별하기 위해 동적 정지어를 제거한다.
  • 시간대별 트윗 시계열에 대해 푸리에 분석을 적용해 파wer 스펙트럼을 계산하여 사용자 게시 동역학을 비교 가능하게 한다.
  • 파워 스펙트럼 간 코사인 유사도를 계산해 그래프 기반 군집화를 위한 가중치가 부여된 인접 행렬을 구성한다.
  • 결과로 생성된 그래프에 대해 최대 모듈러리티 군집화를 적용해 행동 유사성 기반 사용자 공동체를 식별한다.
  • 고차원 트윗 및 활동 데이터의 내재된 구조를 드러내기 위해 다양체 학습을 활용해 차원을 감소시킨다.
  • 워드 클라우드와 정규화된 텍스트 분석을 사용해 주요 주제를 시각화하며, 독일어 및 러시아어의 비영어 콘텐츠도 포함한다.

실험 결과

연구 질문

  • RQ1의심스러운 러시아 트롤 작전이 어떤 다국적 정치적 사건을 대상으로 했으며, 활동 패턴이 이러한 사건과 어떻게 연관되어 있었는가?
  • RQ2트롤 인구 내에서 어떤 언어 공동체가 형성되었으며, 이는 별개의 주제나 언어적 초점을 반영하는가?
  • RQ3비감독 기계학습이 다양한 국가와 선거에서 트롤 활동의 일관된 행동 서명을 탐지할 수 있는가?
  • RQ4트윗 수의 시간적 패턴은 주요 정치 대회나 행사 기간 동안 전략적 타이밍을 반영하는가?
  • RQ5비영어 언어 클러스터(예: 독일어, 러시아어)가 얼마나 좌절된 국경을 넘는 영향 작전을 반영하는가?

주요 결과

  • 트롤 작전은 2016년 RNC 대회 이전과 2017년 5월 9일 제임스 코미 해임 이후에 뚜렷한 활동 급증을 보이며 체계적이고 반응적인 행동을 보였다.
  • 11개의 사용자 공동체가 식별되었으며, 이 중 7개는 주요 주제 클러스터로, 미국 티파티 운동, 아프리카계 미국인 문제, 클리블랜드/오하이오 집중, 그리고 독일어 및 러시아어 비영어 클러스터가 포함되었다.
  • 독일어 클러스터는 2016년과 2017년 독일 선거 기간 동안 활동했으며, 2016년 콘텐츠에는 '#merkelmussbleiben' 해시태그가 포함되어 있었는데, 이는 봇에 의해 생성되었을 가능성이 있으며, 암시적이거나 지지적인 성격을 가졌을 수 있다.
  • 2017년 독일 선거 콘텐츠는 더 일반적이었으며, 더 깊이 있는 분석을 위해 정규화 및 정지어 필터링 개선이 필요할 수 있음을 시사한다.
  • 프랑스 선거 워드 클라우드에서는 신호가 약했으며, 매투롱만 뚜렷한 주제로 나타나, 데이터 품질이나 신호 강도가 제한되어 있음을 시사한다.
  • 러시아어 및 독일어 클러스터 각각은 중심 사용자가 주변 사용자에 영향을 미치는 구조를 보이며, 계층적인 운영 체계를 반영하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.