Skip to main content
QUICK REVIEW

[논문 리뷰] Mega-COV: A Billion-Scale Dataset of 100+ Languages for COVID-19

Muhammad Abdul-Mageed, AbdelRahim Elmadany|arXiv (Cornell University)|2020. 05. 02.
Misinformation and Its Impacts참고 문헌 41인용 수 9
한 줄 요약

Mega-COV는 104개 언어와 268개 국가를 포함하는 10억 규모의 다국어 트위터 데이터셋으로, 2007년부터 100만 명의 사용자로부터 종단적( longitudinal ) 커버리지를 확보하였다. 이 데이터셋은 팬데믹 관련 논의, 오락성 정보, 인간 행동에 대한 대규모 분석을 가능하게 하며, 두 가지 높은 정확도의 모델이 코로나19 관련성 검출에서 F1 점수 97%, 오락성 정보 검출에서 F1 점수 92%를 기록하였다.

ABSTRACT

We describe Mega-COV, a billion-scale dataset from Twitter for studying COVID-19. The dataset is diverse (covers 268 countries), longitudinal (goes as back as 2007), multilingual (comes in 100+ languages), and has a significant number of location-tagged tweets (~169M tweets). We release tweet IDs from the dataset. We also develop and release two powerful models, one for identifying whether or not a tweet is related to the pandemic (best F1=97%) and another for detecting misinformation about COVID-19 (best F1=92%). A human annotation study reveals the utility of our models on a subset of Mega-COV. Our data and models can be useful for studying a wide host of phenomena related to the pandemic. Mega-COV and our models are publicly available.

연구 동기 및 목표

  • 팬데믹 이전 및 동안 기간을 포함하는 대규모 다국어 및 지리적 위치 정보가 포함된 트위터 데이터셋을 구축하여 종단적 분석을 가능하게 하기 위해.
  • _hashtag_ 기반 데이터셋의 한계를 극복하기 위해 사용자 기반 콘텐츠를 수집함으로써 더 넓은 주제 및 언어 다양성을 확보하기 위해.
  • 팬데믹 이전과 동안의 인간 행동, 정보 공유, 오락성 정보 확산에 대한 비교 연구를 가능하게 하기 위해.
  • 대규모로 팬데믹 관련 콘텐츠와 오락성 정보를 식별할 수 있는 기계 학습 모델을 개발하고 검증하기 위해.
  • 재현 가능한 대규모 연구를 지원하기 위해 코로나19의 사회적 영향에 대한 연구를 위해 공개된 트윗 ID와 모델을 제공하기 위해.

제안 방법

  • 해당 키워드 기반의 수집 방식이 아닌 개인 사용자를 대상으로 트위터 API를 활용해 트윗을 수집함으로써 더 넓은 언어적 및 주제적 커버리지를 확보하였다.
  • 268개 국가의 100만 명의 사용자로부터 데이터를 확보하였으며, 사용자당 최대 3,200건의 트윗을 종단적으로 추적함으로써 팬데믹 이전 및 이후의 비교 분석이 가능하도록 하였다.
  • 100개 이상의 언어를 식별하기 위해 다수의 언어 식별 도구를 적용하여, 트위터의 기본 언어 코드 이외의 언어 다양성을 크게 향상시켰다.
  • 코로나19 관련성 여부를 분류하기 위해 트랜스포머 기반의 미세조정 모델을 개발하였으며, 보류된 테스트 세트에서 F1 점수 97%를 달성하였다.
  • 코로나19 오락성 정보를 탐지하기 위해 별도의 이진 분류기를 훈련시켰으며, 언어적 특징과 신호 기반 특징을 조합하여 F1 점수 92%를 기록하였다.
  • 모델 성능 검증 및 데이터셋의 대표성 있는 서브셋에서의 유용성 평가를 위해 인간 주관 평가 연구를 수행하였다.

실험 결과

연구 질문

  • RQ1팬데믹 초반 기간 동안, 키워드 중심의 수집 방식과 비교하여 대규모 사용자 기반 트위터 데이터셋의 언어적 및 지리적 다양성은 어떻게 다를까?
  • RQ2팬데믹 기간 동안 트위터 사용자 행동이 원본 게시보다 리트윗 및 응답에 더 기울어졌는가? 그 정도는 어느 정도인가?
  • RQ3팬데믹 기간 동안 주로 어떤 온라인 뉴스 도메인이 정보의 주요 원천이 되었으며, 지역 간으로는 어떻게 다를까?
  • RQ4데이터셋의 일부를 대상으로 훈련된 기계 학습 모델이 대규모로 팬데믹 관련성과 오락성 정보를 식별하는 데 높은 성능을 달성할 수 있는가?
  • RQ5종단적 사용자 데이터를 통해 팬데믹 기간 동안 건강, 이동성, 사회적 상호작용 등의 주제에서 행동 패턴의 변화에 대해 어떤 통찰을 얻을 수 있는가?

주요 결과

  • Mega-COV는 268개 국가의 100만 명의 사용자로부터 약 15억 건의 트윗을 포함하고 있으며, 1억 6,900만 건 이상의 지리적 위치 정보가 포함되어 있어 글로벌 및 지역적 분석이 가능하다.
  • 데이터셋은 2007년부터 수집된 데이터를 포함하고 있어 팬데믹 이전의 기준선을 확보하고 사용자 행동의 종단적 비교가 가능하다.
  • 언어 식별 도구를 활용해 100개 이상의 고유한 언어를 식별하였으며, 트위터의 기본 언어 코드가 제공하는 65개 언어를 넘어서 언어 다양성을 크게 확장하였다.
  • 연구 결과에 따르면 트위터 사용자 행동에 뚜렷한 변화가 있었으며, 2020년 동안 사용자들이 원본 게시보다 리트윗 및 응답을 더 자주 사용함으로써 의사소통 방식의 변화가 있었음을 시사한다.
  • 국제 뉴스 웹사이트가 주요 정보 원천으로 부상하였으며, 주요 글로벌 언론사의 콘텐츠가 높은 빈도로 공유되었다.
  • 코로나19 관련성 검출 모델은 F1 점수 97%를 달성하였고, 오락성 정보 검출 모델은 F1 점수 92%를 기록하여 인간 주관 평가 서브셋에서 뛰어난 성능을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.