[논문 리뷰] #Election2020: The First Public Twitter Dataset on the 2020 US Presidential Election
이 논문은 2020년 대선 기간 동안 미국 정치적 논의를 추적하는 최초의 공개 가능하고 대규모이며 종단적(Twitter) 데이터셋을 소개한다. 이 데이터셋은 2020년 6월 20일부터 9월 6일까지 2억 4천만 건 이상의 트윗을 수집하였으며, 트윗 스트림 API를 통해 추적한 계정, 해시태그, 키워드를 바탕으로 정제되었다. 이 데이터셋은 팬데믹 기간 동안의 가짜 정보, 정치적 극화, 선거 관련 논의에 대한 연구를 가능하게 한다.
The integrity of democratic political discourse is at the core to guarantee free and fair elections. With social media often dictating the tones and trends of politics-related discussion, it is of paramount important to be able to study online chatter, especially in the run up to important voting events, like in the case of the upcoming November 3, 2020 U.S. Presidential Election. Limited access to social media data is often the first barrier to impede, hinder, or slow down progress, and ultimately our understanding of online political discourse. To mitigate this issue and try to empower the Computational Social Science research community, we decided to publicly release a massive-scale, longitudinal dataset of U.S. politics- and election-related tweets. This multilingual dataset that we have been collecting for over one year encompasses hundreds of millions of tweets and tracks all salient U.S. politics trends, actors, and events between 2019 and 2020. It predates and spans the whole period of Republican and Democratic primaries, with real-time tracking of all presidential contenders of both sides of the isle. After that, it focuses on presidential and vice-presidential candidates. Our dataset release is curated, documented and will be constantly updated on a weekly-basis, until the November 3, 2020 election and beyond. We hope that the academic community, computational journalists, and research practitioners alike will all take advantage of our dataset to study relevant scientific and social issues, including problems like misinformation, information manipulation, interference, and distortion of online political discourse that have been prevalent in the context of recent election events in the United States and worldwide. Our dataset is available at: https://github.com/echen102/us-pres-elections-2020
연구 동기 및 목표
- 컴putational social science 연구를 위한 사회적 미디어 데이터 접근성의 한계를 해결하기 위해.
- 팬데믹 영향을 받는 높은 스테이크스를 가진 선거 기간 동안 정치적 논의의 역동성을 연구할 수 있도록, 미국 선거 관련 트위터 활동의 종단적이고 종합적인 데이터셋을 제공하기 위해.
- 가짜 정보, 정보 조작, 외부 간섭에 대한 연구를 지원하기 위해, 공개 가능하고 지속적으로 업데이트되는 데이터셋을 제공하기 위해.
- 컴퓨터 저널리스트와 연구자들이 전체 2020년 선거 주기 동안 다국어로 구성된 잘 문서화된 데이터셋을 활용할 수 있도록 하기 위해.
- 트위터의 개발자 약관을 준수하면서도 체계적인 정제와 버전 관리를 통해 연구 유용성을 극대화하기 위해.
제안 방법
- Tweepy를 통해 트위터의 스트리밍 API를 사용하여 미국 정치인, 후보자, 핵심 선거 관련 키워드 및 해시태그에 중점을 두고 트윗을 수집하였다.
- 100개 이상의 후보 계정과 100개 이상의 키워드를 추적하였으며, 실제 정치적 동향에 따라 추적 목록을 동적으로 업데이트하였다.
- 캠프의 동향(예: 지지 선언 또는 정지)에 따라 비활동 계정을 제거하고 새로운 계정을 추가하는 정제된 데이터 파이프라인을 구현하였다.
- 구조화된 릴리스 형식으로 데이터를 정리하였으며, v1.0은 2020년 6월 20일부터 9월 6일까지의 트윗을 포함하여 총 2억 4천만 건, 2TB의 원시 데이터로 구성되어 있다.
- 상위 해시태그와 바이그램을 분류하고 분석하여 파벌주의 경향, 음모론, 공중보건 관련 논의를 식별하였다.
- 11월 3일 선거 이후에도 지속적인 데이터 수집을 수행하였으며, GitHub 리포지토리에 정기적으로 업데이트하였다.
실험 결과
연구 질문
- RQ12020년 미국 대선 기간 동안 트위터 논의의 량과 정서가 시간이 지남에 따라 어떻게 변화했는가? 특히 예비 선거 및 본선 단계에서 어떻게 변화했는가?
- RQ22020년 선거 주기 동안 외부 간섭과 조작된 가짜 정보 캠페인이 트위터에서 선거 관련 논의에 어떤 영향을 미쳤는가?
- RQ3코로나19 팬데믹으로 인한 가상 캠페인 전환은 트위터에서 정치적 메시지의 톤과 영향 범위에 어떤 영향을 미쳤는가?
- RQ42020년 선거 기간 동안 파벌주의를 자극하거나 음모론을 확산시키는 데 가장 자주 사용된 해시태그와 키워드는 무엇인가?
- RQ5마일리지 투표나 팬데믹과 같은 공중보건 문제는 트위터에서 정치적 논의와 얼마나 밀접하게 얽혀 있었는가?
주요 결과
- 2020년 6월 20일부터 9월 6일까지 수집된 데이터셋은 총 2억 4천 22만 5,806건의 트윗을 포함하며, 원시 데이터 기준 약 2TB에 이른다.
- 이 데이터셋은 양당의 주요 대통령 및 부통령 후보자들을 실시간으로 추적하며, 추적 목록에 대한 동적 업데이트를 제공한다.
- MAGA, #BidenHarris2020, #WWG1WGA, #COVID19 등의 상위 해시태그는 파벌주의 자극과 팬데믹 관련 논의를 반영하며 자주 사용되었다.
- "president @realdonaldtrump" 및 "joe biden"과 같은 바이그램은 가장 흔하게 사용된 것으로 나타나, 주요 정치 인물에 대한 높은 참여도를 보였다.
- QAnon 및 빕드 우크라이나 스캔들 등의 음모론이 확산되면서, #VoteRed 및 #VoteBlue와 같은 파벌주의 해시태그와 함께 데이터셋에 기록되었다.
- 이 데이터셋은 GitHub에서 공개되어 있으며, 11월 3일 선거 이후에도 매주 업데이트되어 장기적인 연구 유용성을 확보하고 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.