Skip to main content
QUICK REVIEW

[논문 리뷰] EDNA-Covid: A Large-Scale Covid-19 Tweets Dataset Collected with the EDNA Streaming Toolkit

Abhijit Suprem, Calton Pu|arXiv (Cornell University)|2020. 10. 06.
Misinformation and Its Impacts참고 문헌 15인용 수 4
한 줄 요약

이 논문은 EDNA 스트리밍 툴킷을 사용해 2020년 1월부터 수집한 6억 건이 넘는 트윗을 포함한 대규모 다국어 트위터 데이터셋인 EDNA-Covid를 소개한다. 이 데이터셋은 변화하는 팬데믹 논의를 반영하며 개념 드리프트가 뚜렷하게 나타나, 실시간 NLP, 가짜 정보 탐지 및 동적 데이터 분포 하에서의 스트리밍 분석 연구를 가능하게 한다.

ABSTRACT

The Covid-19 pandemic has fundamentally altered many facets of our lives. With nationwide lockdowns and stay-at-home advisories, conversations about the pandemic have naturally moved to social networks, e.g. Twitter. This affords an unprecedented insight into the evolution of social discourse in the presence of a long-running destabilizing factor such as a pandemic with the high-volume, high-velocity, high-noise Covid-19 Twitter feed. However, real-time information extraction from such a data stream requires a fault-tolerant streaming infrastructure to perform the non-trivial integration of heterogenous data sources from news organizations, social feeds, and authoritative medical organizations like the CDC. To address this, we present (i) the EDNA streaming toolkit for consuming and processing streaming data, and (ii) EDNA-Covid, a multilingual, large-scale dataset of coronavirus-related tweets collected with EDNA since January 25, 2020. EDNA-Covid includes, at time of this publication, over 600M tweets from around the world in over 10 languages. We release both the EDNA toolkit and the EDNA-Covid dataset to the public so that they can be used to extract valuable insights on this extraordinary social event.

연구 동기 및 목표

  • 지속 중인 코로나19 팬데믹 기간 동안 고속도, 고노이즈의 소셜 미디어 데이터를 실시간으로 고장 내성적으로 수집 및 처리하는 도전 과제를 해결하기 위해.
  • 스트리밍 NLP, 가짜 정보 탐지 및 사회적 역학 연구를 위한 대규모 다국어이며 개념 드리프트가 발생하는 데이터셋을 제공하기 위해.
  • 실세계 스트리밍 데이터를 사용해 기계 학습 모델에서 개념 드리프트 탐지 및 적응 메커니즘의 개발 및 테스트를 가능하게 하기 위해.
  • 제어된 액세스 하에 EDNA 스트리밍 툴킷과 EDNA-Covid 데이터셋을 공개함으로써 재현 가능한 연구를 지원하기 위해.

제안 방법

  • EDNA는 수집-처리-출력 파이프라인 아키텍처를 기반으로 한 스트리밍 툴킷으로, 실시간 데이터 스트림의 고장 내성적이고 확장 가능한 처리를 가능하게 한다.
  • 이 툴킷은 EDNA 작업의 DAG 기반 조합을 사용하며, 각 작업은 수집, 변환 및 출력 작업을 모듈식 스트림 처리를 위해 봉인한다.
  • EDNA-Covid는 키워드 기반 필터링과 병렬화된 메타데이터 추출을 통해 트위터 데이터를 수집했으며, Redis를 통한 동적 업데이트를 통해 가짜 정보 키워드 캐시를 관리했다.
  • 시스템은 다단계 파이프라인을 활용한다: 트위터에서 수집, 메타데이터 추출, 관련 키워드(예: 'covid', 'pandemic') 필터링, 그리고 위키백과 및 이전 연구에서 확보한 키워드 목록을 사용한 가짜 정보 탐지.
  • 개념 드리프트는 키워드 빈도의 시계열 분석을 통해 캡처되었으며, '우한'과 같은 기원 관련 용어에서 '마스크', '팬데믹' 등의 질병 및 정책 관련 용어로의 이동을 보여주었다.
  • 데이터는 트위터의 이용 약관에 따라 트윗 ID만 공개되며, twarc와 같은 도구를 사용해 하이드레이션(재구성)이 필요하며, GitHub에 샘플 데이터가 공개되어 있다.

실험 결과

연구 질문

  • RQ1글로벌 팬데믹 사건 기간 동안 고속도, 다국어 소셜 미디어 데이터를 실시간으로 효과적으로 수집 및 처리할 수 있는 고장 내성적 스트리밍 인fra구조는 어떻게 설계될 수 있는가?
  • RQ2트위터에서의 코로나19 논의가 시간이 지남에 따라 얼마나 개념 드리프트를 보이며, 이러한 드리프트는 실시간 데이터에서 어떻게 정량적으로 관찰될 수 있는가?
  • RQ3팬데믹 초반의 혼란에서 정책 논의 및 가짜 정보로 이르는 공적 논의의 언어적 및 주제적 변화는 무엇인가?
  • RQ4EDNA와 같은 스트리밍 툴킷은 어떻게 실시간 분석, 특히 가짜 정보 탐지 및 토픽 모델링을 위해 변화하는 소셜 미디어 데이터를 지원할 수 있는가?
  • RQ5대규모 소셜 미디어 데이터 수집을 위한 확장 가능하고 프로덕션 수준의 스트리밍 파이프라인을 구축할 때의 실용적 과제와 설계 고려사항은 무엇인가?

주요 결과

  • EDNA-Covid는 2020년 1월 25일부터 9월 30일까지 수집된 6억 건 이상의 트윗을 포함하며, 10개 이상의 언어를 다루며, 그 중 영어가 63.4%를 차지한다.
  • 이 데이터셋은 명확한 개념 드리프트를 보이며, 키워드 빈도가 1월의 '우한'에서 2월의 '코로나19', 3월의 '팬데믹', 7월의 '마스크'로 변화함으로써 공적 논의의 변화를 반영한다.
  • 스페인어, 남아시아(인도네시아어, 자와어, 말라가시어), 프랑스어, 포르투갈어가 다음으로 자주 사용된 언어로, 총 12.0%의 데이터를 차지한다.
  • 가짜 정보 탐지는 위키백과 및 이전 연구에서 확보한 키워드 목록을 기반으로 동적 업데이트된 키워드 캐시를 통해 지원되었으며, 수집 과정에서 실시간 필터링이 적용되었다.
  • 2020년 6월에 도입된 병렬화된 메타데이터 추출 파이프라인 덕분에 트윗 손실률이 감소하고 수집 효율성이 향상되었다.
  • 트위터의 이용 약관에 따라 공개된 데이터는 트윗 ID 뿐이며, 등록 절차를 거쳐 공개되며, 전체 트윗은 twarc와 같은 외부 도구를 통해 하이드레이션(재구성)이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.