Skip to main content
QUICK REVIEW

[논문 리뷰] ArCov-19: The First Arabic COVID-19 Twitter Database with Propagation Networks

Fatima Haouari, Maram Hasanain|arXiv (Cornell University)|2020. 04. 18.
Misinformation and Its Impacts참고 문헌 21인용 수 4
한 줄 요약

ArCOV-19는 아랍권에서 코로나19 팬데믹 초기 단계를 다루는 공개된 첫 번째 아랍어 트위터 데이터셋으로, 2020년 1월 27일부터 3월 31일까지 약 748만 건의 인기 트윗과 그들의 확산 네트워크(재트윗 및 대화형 답글 스레드 포함)를 포함한다. 이 데이터셋은 자연어 처리, 정보 검색 및 소셜 컴퓨팅 분야의 연구를 가능하게 하며, 공개된 검색 쿼리와 언어에 종속되지 않는 크롤러를 제공하여 향후 데이터셋 정제를 지원한다.

ABSTRACT

In this paper, we present ArCOV-19, an Arabic COVID-19 Twitter dataset that covers the period from 27th of January till 31st of March 2020. ArCOV-19 is the first publicly-available Arabic Twitter dataset covering COVID-19 pandemic that includes around 748k popular tweets (according to Twitter search criterion) alongside the propagation networks of the most-popular subset of them. The propagation networks include both retweets and conversational threads (i.e., threads of replies). ArCOV-19 is designed to enable research under several domains including natural language processing, information retrieval, and social computing, among others. Preliminary analysis shows that ArCOV-19 captures rising discussions associated with the first reported cases of the disease as they appeared in the Arab world. In addition to the source tweets and the propagation networks, we also release the search queries and the language-independent crawler used to collect the tweets to encourage the curation of similar datasets.

연구 동기 및 목표

  • 아랍권에서 코로나19 팬데믹 초기 단계에 대한 공개된 아랍어 소셜 미디어 데이터셋의 부족을 해소하기 위해.
  • 코로나19와 관련된 아랍어 트윗의 대규모이고 고품질의 데이터셋을 제공하며, 이를 통해 구조화된 확산 네트워크를 포함하기 위해.
  • 트윗 외에도 기초 검색 쿼리와 크롤러 코드를 공개하여 자연어 처리, 정보 검색 및 소셜 컴퓨팅 분야의 연구를 지원하기 위해.

제안 방법

  • 2020년 1월 27일부터 3월 31일까지 정해진 키워드와 시간 제약 조건을 기반으로 트위터의 검색 API를 사용해 아랍어 트윗을 수집하기 위해.
  • 트위터의 인기 기준을 적용하여 가장 많이 재트윗되고 참여도가 높은 트윗을 선별하여 약 748만 건의 트윗을 확보하기 위해.
  • 가장 인기 있는 트윗 서브셋의 확산 네트워크를 추출하여 재트윗과 대화형 답글 스레드를 모두 포함하기 위해.
  • 향후 유사한 아랍어 소셜 미디어 데이터셋의 복제 및 정제를 용이하게 하기 위해 언어에 종속되지 않는 웹 크롤러를 설계하기 위해.
  • 재현 가능성과 투명성을 높이기 위해 원본 검색 쿼리와 크롤러 코드를 공개하기 위해.

실험 결과

연구 질문

  • RQ1팬데믹 초기 단계 동안 아랍권에서 코로나19에 대한 공적 논의는 어떻게 변화했는가?
  • RQ2팬데믹 초기 단계 동안 아랍어 트위터에서 정보 확산의 구조적 특성은 어떠한가?
  • RQ3재트윗과 대화형 스레드의 차이점은 아랍어 트위터에서 코로나19 관련 콘텐츠의 확산에 어떻게 영향을 미치는가?
  • RQ4이 데이터셋은 아랍어와 같이 자원이 제한된 언어에서의 후속 자연어 처리 및 소셜 컴퓨팅 응용 프로그램을 얼마나 잘 지원할 수 있는가?
  • RQ5유사한 多국어 소셜 미디어 데이터셋을 정제하기 위한 표준화된 방법론적 절차는 무엇인가?

주요 결과

  • 이 데이터셋은 아랍권에서 첫 번째 코로나19 확진 사례가 보고된 이후 공적 논의의 출현과 확산을 포착한다.
  • ArCOV-19는 약 748,000건의 인기 있는 아랍어 트윗을 포함하며, 재트윗 및 답글 스레드의 상세한 확산 네트워크를 제공한다.
  • 데이터셋은 빠른 속도로 확산되는 재트윗과 복잡한 대화 구조를 띤 답글 스레드를 포함한 정보 확산의 고유한 패턴을 드러낸다.
  • 검색 쿼리와 언어에 종속되지 않는 크롤러의 공개는 유사한 데이터셋의 재현 가능하고 확장 가능한 정제를 가능하게 한다.
  • 초기 분석 결과, 이 데이터셋은 팬데믹 초기 단계 동안 실시간 공적 감정과 정보 공유를 반영하고 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.