Skip to main content
QUICK REVIEW

[논문 리뷰] Happenstance: Utilizing Semantic Search to Track Russian State Media Narratives about the Russo-Ukrainian War On Reddit

Hans W. A. Hanley, Dinesh Kumar|arXiv (Cornell University)|2022. 05. 28.
Opinion Dynamics and Social Influence인용 수 12
한 줄 요약

이 논문은 러시아 정부 산하 미디어의 러시아-우크라이나 전쟁에 대한 서사 구조를 뉴스 사이트와 Reddit에서 추적하기 위해 MPNet 언어 모델을 사용한 문장 수준의 의미적 검색 접근법을 제안한다. 문장을 조밀한 벡터 공간에 임bedding하고 UMAP, HDBSCAN, TF-IDF 클러스터링을 적용함으로써 허위 정보 주제를 식별하고 그 확산을 맵핑한다. 그 결과, r/Russia 댓글의 39.6%가 러시아 선전 서사와 일치하는 것으로 나타났으며, 이는 r/politics의 8.86%보다 훨씬 높은 비율이다.

ABSTRACT

In the buildup to and in the weeks following the Russian Federation's invasion of Ukraine, Russian state media outlets output torrents of misleading and outright false information. In this work, we study this coordinated information campaign in order to understand the most prominent state media narratives touted by the Russian government to English-speaking audiences. To do this, we first perform sentence-level topic analysis using the large-language model MPNet on articles published by ten different pro-Russian propaganda websites including the new Russian "fact-checking" website waronfakes.com. Within this ecosystem, we show that smaller websites like katehon.com were highly effective at publishing topics that were later echoed by other Russian sites. After analyzing this set of Russian information narratives, we then analyze their correspondence with narratives and topics of discussion on the r/Russia and 10 other political subreddits. Using MPNet and a semantic search algorithm, we map these subreddits' comments to the set of topics extracted from our set of Russian websites, finding that 39.6% of r/Russia comments corresponded to narratives from pro-Russian propaganda websites compared to 8.86% on r/politics.

연구 동기 및 목표

  • 뉴스 및 소셜 미디어 플랫폼 간 허위 정보 서사의 확산을 정량적으로 추적할 수 있는 프로그래밍 기반 방법을 개발하기 위해.
  • 허위 정보 탐지에서 키워드 기반 및 LDA 기반 주제 모델링의 한계를 극복하여 미묘한 의미적 유사성을 가진 허위 정보를 탐지하기 위해.
  • 특정 허위 정보 서사를 가장 많이 기원하고 확산시키는 러시아 정부 산하 미디어 웹사이트를 특정하기 위해.
  • 러시아 정부 산하 미디어 서사가 영어권 소셜 미디어 토론, 특히 Reddit에서 얼마나 광범위하게 나타나는지 정량화하기 위해.
  • 대규모 언어 모델을 활용한 문장 수준의 의미 분석이 실제 갈등 상황에서 허위 정보 추적에 얼마나 효과적인지 입증하기 위해.

제안 방법

  • 10개의 프로-러시아 선전 웹사이트에서 기사의 문장을 MPNet 언어 모델을 사용해 조밀한 의미적 문장 임베딩으로 생성한다. 이 중 waronfakes.com 포함.
  • 문장 임베딩의 차원을 줄이기 위해 UMAP를 적용하여 국소적 및 전반적인 의미적 구조를 유지한다.
  • HDBSCAN 클러스터링을 사용해 의미적으로 유사한 문장을 일관된 주제로 그룹화하며, 각 문장은 하나의 주요 주제를 표현한다고 가정한다.
  • 각 클러스터에 대해 클래스 기반 TF-IDF를 적용하여 주제 키워드를 추출함으로써 식별된 서사의 해석 가능성을 높인다.
  • Reddit 댓글을 동일한 임bedding 공간에 매핑하고 코사인 유사도 기반으로 각 댓글을 가장 가까운 클러스터에 매칭함으로써 의미적 검색을 수행한다.
  • 신뢰성 있는 댓글과 뉴스 기사 주제 간의 서사 일치를 확보하기 위해 최소 의미 유사도 임계값을 설정한다.

실험 결과

연구 질문

  • RQ1러시아 정부 산하 미디어 웹사이트 중 러시아-우크라이나 전쟁에 대한 허위 정보 서사를 가장 효과적으로 기원하고 확산시키는 곳은 어디인가?
  • RQ2러시아 정부 산하 미디어의 서사는 영어권 Reddit 토론, 특히 r/Russia에서 어느 정도 확산되는가?
  • RQ3r/Russia에서 러시아 정부 산하 미디어 서사의 확산 정도는 r/politics와 같은 다른 정치 서브레딧과 비교해 어떻게 다른가?
  • RQ4문장 수준의 의미 분석이 키워드 기반 또는 문서 수준의 주제 모델링보다 허위 정보의 플랫폼 간 확산을 탐지하는 데 더 나은 성능을 보일 수 있는가?
  • RQ5미국의 생물무기 연구나 '나치화 청소' 주장과 같은 특정 허위 정보 서사가 다양한 서브레딧 간에 어떻게 확산되는가?

주요 결과

  • katehon.com, strategic-culture.org, geopolitica.ru와 같은 웹사이트가 높은 영향력을 지녔으며, 다른 출판사들은 새로운 서사를 도입할 때 평균 21건의 추가 기사를 생산했다.
  • 미국이 우크라이나에서 생물무기 연구를 자금 지원하고 있다는 서사는 널리 퍼졌으며, 러시아 투데이에서 35건, 스푸트니크 뉴스에서 44건의 기사가 이를 홍보했다.
  • 2022년 1월 1일부터 3월 15일까지 r/Russia의 댓글 중 39.6%가 러시아 정부 산하 미디어 웹사이트의 서사와 의미적으로 일치했다.
  • 반면 r/politics에서는 같은 서사와 연관된 댓글 비율이 오직 8.86%에 불과하여 r/Russia가 이 서사에 더 노출되어 있음을 시사한다.
  • r/Russia가 봉쇄되었음에도 불구하고, 다른 서브레딧에 비해 여전히 높은 수준의 허위 정보 관련 콘텐츠가 유지되었다.
  • 의미적 검색 접근법은 미국의 생물무기 서사와 우크라이나에서의 나치주의 상승 주장이라는 두 가지 주요 허위 정보 서사를 11개의 서브레딧에서 성공적으로 추적하여, 이 방법의 확장성과 정밀도를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.