Skip to main content
QUICK REVIEW

[논문 리뷰] VoterFraud2020: a Multi-modal Dataset of Election Fraud Claims on Twitter

Anton Abilov, Yiqing Hua|arXiv (Cornell University)|2021. 01. 20.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

이 논문은 2020년 10월 23일부터 12월 16일까지 티커트에서 발생한 미국 선거 부정행위 주장과 관련된 760만 개의 트윗과 2560만 개의 재트윗을 포함하는 대규모 다중모달 데이터셋인 VoterFraud2020을 소개한다. 이 데이터셋은 재트윗 기반 사용자 클러스터, 정지 상태, 16만 8000개 이미지의 감각 해시, 외부 링크 13만 8000개와 유튜브 영상 1만 2000개의 집계된 메타데이터를 추가로 제공하여 가짜 정보 네트워크와 플랫폼 대응 방식을 분석할 수 있도록 한다.

ABSTRACT

The wide spread of unfounded election fraud claims surrounding the U.S. 2020 election had resulted in undermining of trust in the election, culminating in violence inside the U.S. capitol. Under these circumstances, it is critical to understand the discussions surrounding these claims on Twitter, a major platform where the claims were disseminated. To this end, we collected and released the VoterFraud2020 dataset, a multi-modal dataset with 7.6M tweets and 25.6M retweets from 2.6M users related to voter fraud claims. To make this data immediately useful for a diverse set of research projects, we further enhance the data with cluster labels computed from the retweet graph, each user's suspension status, and the perceptual hashes of tweeted images. The dataset also includes aggregate data for all external links and YouTube videos that appear in the tweets. Preliminary analyses of the data show that Twitter's user suspension actions mostly affected a specific community of voter fraud claim promoters, and exposes the most common URLs, images and YouTube videos shared in the data.

연구 동기 및 목표

  • 1월 6일 의회 폭도 사건에 기여한 근거 없는 선거 부정행위 주장의 확산에 대한 실증적 데이터가 부족한 문제를 해결하기 위해.
  • API 제한에도 불구하고 2020년 미국 선거 부정행위 주장 주변의 티커트 논의를 포괄적으로 수집하고 공개하기 위해.
  • 더 넓은 연구 활용성을 위해 사용자 클러스터, 정지 상태, 이미지 감각 해시, 링크 메타데이터 등 실질적인 레이블을 원시 데이터에 추가하기 위해.
  • 연구자들이 가짜 정보 네트워크의 구조, 플랫폼 모더레이션의 영향, 시각적 및 영상 콘텐츠가 주장 확산에 미치는 역할을 연구할 수 있도록 하기 위해.
  • 선거의 투명성, 가짜 정보, 고위험 민주적 행사에서 콘텐츠 모더레이션 정책의 효과성에 대한 학술 연구를 지원하기 위해.

제안 방법

  • 2020년 10월 23일부터 12월 16일까지 55일 간격으로, 티커트 스트리밍 API를 통해 수동으로 코딩된 关련 키워드 집합(예: 'voter fraud', '#stopthesteal')을 기반으로 트윗을 수집하였다.
  • API 속도 제한 및 표본 검증을 바탕으로, 목표 키워드를 포함한 트윗의 약 60% 정도를 커버한 것으로 추정하였다.
  • 재트윗 그래프 기반 클러스터링 알고리즘을 사용하여 사용자 커뮤니티 레이블을 계산하여 유기적인 논의 네트워크를 식별하였다.
  • 2021년 1월 10일 기준으로 사용자 정지 상태를 확보하고 플랫폼 모더레이션 효과를 분석하였다.
  • 16만 8000개의 이미지에 대해 감각 해시를 생성하여 시각적 유사성 분석 및 이미지 추적을 가능하게 하였다.
  • 외부 링크 13만 8000개와 고유한 유튜브 영상 1만 2000개의 메타데이터를 집계하였으며, 영상 ID, URL, 참여 지표를 포함하였다.

실험 결과

연구 질문

  • RQ1선거 부정행위 주장을 홍보한 주요 사용자 커뮤니티는 어디이며, 티커트의 정지 조치는 이들에 어떤 영향을 미쳤는가?
  • RQ2선거 부정행위 주장과 연결되어 널리 공유된 시각적 콘텐츠와 영상 콘텐츠의 유형은 무엇이며, 그 영향력과 유사성은 어떻게 비교되는가?
  • RQ3부정행위 주장 홍보자들이 참조하는 외부 링크들은 신뢰성과 영향력 측면에서 어떻게 비교되는가. 특히 유튜브와 저질 뉴스 사이트로 향하는 링크들은 어떤가?
  • RQ4플랫폼 모더레이션, 예를 들어 사용자 정지 조치가 부정행위 주장 홍보를 위한 특정 사용자 클러스터를 얼마나 정확히 대상으로 했는가?
  • RQ5부정행위 주장과 관련된 가장 많이 재트윗된 이미지와 영상 간에는 시각적 콘텐츠와 배포 패턴에서 어떤 차이가 있는가?

주요 결과

  • 주로 QAnon과 연관된 부정행위 주장 홍보 사용자 클러스터 중 상당수는 티커트의 정지 조치에 비례하여 집중적으로 대상이 되었으며, 이 커뮤니티의 사용자 약 7.8%가 정지되었다.
  • 재트윗 수 기반으로 가장 널리 공유된 이미지는 가장 많이 재트윗된 이미지와 시각적으로 다소 다름을 보여, 유행성에 영향을 주는 시각적 전략이 다를 수 있음을 시사한다.
  • 부정행위 주장 확산에 기여한 상위 10개 유튜브 채널은 규모는 작았지만 막대한 영향력을 발휘했으며, 2021년 1월 11일 기준 모두 활성 상태였다.
  • 부정행위 주장 홍보자들이 참조하는 외부 링크는 주로 저질 뉴스 웹사이트, 스트리밍 서비스, 유튜브로 향했으며, 주요 언론 매체의 존재는 극히 미미했다.
  • 정지 상태 및 감각 해시를 포함한 데이터셋의 강화된 레이블은 연구자들이 가짜 정보를 주도하는 핵심 네트워크를 식별하고 분석할 수 있도록 했다.
  • 정지된 사용자의 트윗이 삭제되었음에도 불구하고, 공개된 데이터셋은 트윗 ID와 이미지 해시를 유지하고 있어, 윤리적인 학술 접근을 위한 핵심 콘텐츠 접근이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.