Skip to main content
QUICK REVIEW

[논문 리뷰] Large Arabic Twitter Dataset on COVID-19

Sarah Alqurashi, Ahmad Alhindi|arXiv (Cornell University)|2020. 04. 09.
Misinformation and Its Impacts참고 문헌 3인용 수 33
한 줄 요약

이 논문은 COVID-19에 관한 최초의 아랍어 Twitter 데이터셋을 2020년 1월 1일부터 수집하여 390만 개가 넘는 아랍어 트윗과 관련 메타데이터를 제공하고, 데이터 수집 방법 및 초기 통계를 제시합니다.

ABSTRACT

The 2019 coronavirus disease (COVID-19), emerged late December 2019 in China, is now rapidly spreading across the globe. At the time of writing this paper, the number of global confirmed cases has passed two millions and half with over 180,000 fatalities. Many countries have enforced strict social distancing policies to contain the spread of the virus. This have changed the daily life of tens of millions of people, and urged people to turn their discussions online, e.g., via online social media sites like Twitter. In this work, we describe the first Arabic tweets dataset on COVID-19 that we have been collecting since January 1st, 2020. The dataset would help researchers and policy makers in studying different societal issues related to the pandemic. Many other tasks related to behavioral change, information sharing, misinformation and rumors spreading can also be analyzed.

연구 동기 및 목표

  • COVID-19 기간 동안 아랍어 사용 대중의 담론 및 행동 변화 연구 동기를 부여한다.
  • 정보 확산, 감정, 오정보 분석을 위한 대규모 아랍어 Twitter 데이터셋을 제공한다.
  • 연구자와 정책입안자를 위한 데이터 수집 방법, 전처리 계획 및 초기 사용 지침을 설명한다.

제안 방법

  • 2020년 1월 1일부터 2020년 4월 15일까지 Twitter streaming API와 Tweepy를 사용하여 아랍어 COVID-19 관련 트윗을 수집한다.
  • 트윗 아이디, 사용자이름, 해시태그, 지오로케이션 등 전체 트윗 객체를 가능할 때 유지한다.
  • 아랍어 COVID-19 관련 용어를 추적하기 위한 영어 번역 키워드 목록을 생성하고 streaming API를 통해 관련 트윗을 추적한다.
  • 아랍어 Twitter 담론에서 COVID-19를 모니터링하기 위해 해시태그의 집합과 날짜를 추적한다.
  • 관련 없는 트윗은 제외하여 팬데믹 관련 콘텐츠를 유지한다.
  • GitHub를 통해 데이터셋에 접근을 제공하고 Twitter 정책에 따라 트윗 ID만 배포하며, Hydrator 같은 도구로 전체 객체를 재수집할 수 있음을 명시한다.

실험 결과

연구 질문

  • RQ12020년 1월 1일부터 4월 15일까지 아랍어 트위터 활동의 양과 시간적 패턴은 어떠한가?
  • RQ2수집된 아랍어 COVID-19 트윗 중 지오태깅이 된 비율은 얼마나 되며 원본 트윗과 리트윗은 각각 몇 개인가?
  • RQ3아랍어 COVID-19 담론에서 어떤 키워드와 해시태그가 지배적이며 시간이 지남에 따라 어떻게 변화하는가?
  • RQ4연구자들이 이 데이터셋을 활용해 정보 공유, 오정보, 행동 반응을 어떻게 연구할 수 있는가?
  • RQ5데이터셋을 연구에 사용할 때의 한계와 데이터 접근 고려사항은 무엇인가?

주요 결과

  • 2020년 1월 1일 이후 COVID-19와 관련된 아랍어 트윗을 3,934,610건 이상 수집했다.
  • 지오로케이션 데이터는 219건에 대해 사용 가능하고, 3,934,235건은 원본 트윗이며 375건은 리트윗이다.
  • 일일 평균 트윗 수집 속도는 77,471건이다.
  • 관련 트윗을 추적하기 위해 키워드와 해시태그의 목록을 사용했으며, 표 1은 키워드 추적 날짜를, 표 2는 해시태그 및 카운트를 보인다.
  • 데이터셋은 GitHub에 호스팅되며 트윗의 콘텐츠 재배포 정책을 준수하기 위해 트윗 ID만 배포한다; 전체 객체는 Hydrator 같은 도구로 재수집할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.