Skip to main content
QUICK REVIEW

[논문 리뷰] A curated collection of COVID-19 online datasets

Isa Inuwa-Dutse, Ioannis Korkontzelos|arXiv (Cornell University)|2020. 07. 19.
Misinformation and Its Impacts참고 문헌 12인용 수 6
한 줄 요약

이 논문은 트위터, 신뢰할 수 있는 보건 자료, WHO 글로벌 상황 보고서로부터 수집한 총 1,169개의 코로나19 관련 데이터셋을 제시하며, 위기 정보 확산 방지 연구를 지원한다. 이 데이터셋은 콘텐츠 분류, 진위 확인, 어조 분석, 오락성 정보 확산 분석, 주제 분석, 정책 감성 추적에 활용되며, 완전한 텍스트 복원(하이드레이션) 지원과 사실 확인 시스템의 기준 설정을 가능하게 한다.

ABSTRACT

One of the defining moments of the year 2020 is the outbreak of Coronavirus Disease (Covid-19), a deadly virus affecting the body's respiratory system to the point of needing a breathing aid via ventilators. As of June 21, 2020 there are 12,929,306 confirmed cases and 569,738 confirmed deaths across 216 countries, areas or territories. The scale of spread and impact of the pandemic left many nations grappling with preventive and curative approaches. The infamous lockdown measure introduced to mitigate the virus spread has altered many aspects of our social routines in which demand for online-based services skyrocketed. As the virus propagate, so does misinformation and fake news around it via online social media, which seems to favour virality over veracity. With a majority of the populace confined to their homes for a long period, vulnerability to the toxic impact of online misinformation is high. A case in point is the various myths and disinformation associated with the Covid-19, which, if left unchecked, could lead to a catastrophic outcome and hamper the fight against the virus. While the scientific community is actively engaged in identifying the virus treatment, there is a growing interest in combating the associated harmful infodemic. To this end, researchers have been curating and documenting various datasets about Covid-19. In line with existing studies, we provide an expansive collection of curated datasets to support the fight against the pandemic, especially concerning misinformation. The collection consists of 3 categories of Twitter data, information about standard practices from credible sources and a chronicle of global situation reports. We describe how to retrieve the hydrated version of the data and proffer some research problems that could be addressed using the data.

연구 동기 및 목표

  • 코로나19 패an드믹 기간 동안 오락성 정보 및 가짜 뉴스를 연구하기 위한 기초 데이터셋과 정제된 데이터셋의 부족 문제를 해결하기 위해.
  • 다양한 출처에서 유래한 구조화되고 접근 가능한, 하이드레이션된 데이터를 제공함으로써 위기 정보 확산의 동적 메커니즘에 대한 계산 기반 연구를 지원하기 위해.
  • 소셜 미디어에서 오락성 정보를 탐지하고 분류하며 검증하는 시스템의 개발과 기준 설정을 가능하게 하기 위해.
  • 패닉 관련 주제에 대한 공적 논의의 종단적 및 주제별 분석을 가능하게 하며, 정책 감성과 커뮤니티 구조를 포함한다.
  • 위기 상황에서 사실 확인 및 오락성 정보 억제를 위한 신뢰할 수 있는 기준 설정을 지원하기 위해.

제안 방법

  • 주요 데이터 유형 3종의 수집: 해시태그, 계정, 시간 기반 필터링가 가능한 트위터 데이터셋, 검증된 신뢰할 수 있는 자료에서 온 보건 지침, WHO 글로벌 상황 보고서.
  • 공식 트위터 API를 활용해 원시 트윗 ID를 수신하고 하이드레이션하여 분석을 위한 전체 트윗 내용을 복원.
  • 데이터 정제 기법을 적용하여 데이터셋 간 일관성, 관련성, 기초 데이터와의 일치를 확보.
  • 콘텐츠 기울기를 기반으로 사용자를 WHO 찬성 및 반대 그룹으로 분류하여 커뮤니티 탐지 및 감성 분석을 가능하게 함.
  • 외부 사실 확인 자원(예: IFCN, AFP) 통합을 통해 트윗의 진위를 검증하고 기준 설정에 기여.
  • 스트리밍 API를 활용해 실시간 데이터를 수집한 후 필터링 및 주제 기반 군집화를 수행하여 패닉 관련 주제에 집중.

실험 결과

연구 질문

  • RQ1소셜 미디어에서 진정한 패닉 관련 정보와 오락성 정보를 구분하기 위해 콘텐츠 분류 모델을 어떻게 훈련시킬 수 있는가?
  • RQ2권위 있는 보건 자료에서 제공하는 기초 데이터를 활용해 트윗의 진위를 검증하는 데 가장 효과적인 방법은 무엇인가?
  • RQ3오락성 정보의 어조(예: 감정적, 부정적, 과장된)는 사실 기반 콘텐츠와 어떻게 다를까?
  • RQ4패닉 기간 동안 오락성 정보와 정확한 정보의 확산에 관여하는 구조적 및 행동 패턴은 어떠한가?
  • RQ5봉쇄 정책에 대한 공적 감성은 시간이 지남에 따라 어떻게 변화하는가? 감성은 정책 조치와 신뢰성 있게 연결될 수 있는가?

주요 결과

  • 총 1,169개의 정제된 데이터셋을 트위터, WHO 보고서, 검증된 보건 자료에서 확보하여 위기 정보 확산 연구에 포괄적인 기반을 제공한다.
  • 하이드레이션된 트윗 데이터 포함으로 원시 ID 전용 데이터셋의 한계를 극복하고 전체 텍스트 분석이 가능해졌다.
  • 이 데이터셋은 WHO 찬성 및 반대 그룹을 포함한 고유한 사용자 커뮤니티 식별을 가능하게 하며, 겹치는 하위 커뮤니티 가능성도 제공한다.
  • 이 데이터셋은 종단적 감성 분석을 가능하게 하여 패닉 조치에 대한 공적 인식의 시간에 따른 변화를 보여준다.
  • 권위 있는 자료 통합을 통해 사실 확인 및 오락성 정보 탐지 시스템의 기준 설정이 가능해졌다.
  • 주제 기반 필터링 및 군집화를 통해 특정 주제 중심의 트윗 분석이 가능해져 맥락 이해도 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.