Skip to main content
QUICK REVIEW

[논문 리뷰] A Large-Scale Comparative Study of Accurate COVID-19 Information versus Misinformation

Yida Mu, Ye Jiang|arXiv (Cornell University)|2023. 04. 10.
Misinformation and Its Impacts인용 수 4
한 줄 요약

이 연구는 242만 건의 코로나19 트윗을 대규모로 비교 분석하여 정확한 정보와 오락성 정보의 고유한 특징을 특정하기 위해 새로운 증거 기반 오락성 정보 분류 데이터셋을 활용한다. 결과적으로 오락성 정보는 정확한 콘텐츠보다 158% 더 빠르게 퍼지며, 부정적 감정과 음모론 주제와 강하게 관련되어 있으며, 플랫폼에 의해 특히 음모론 관련 내용에서 비례적으로 더 많이 제거된다. 반면 기원 관련 오락성 정보는 여전히 대부분 관리되지 않은 상태로 남아 있다.

ABSTRACT

The COVID-19 pandemic led to an infodemic where an overwhelming amount of COVID-19 related content was being disseminated at high velocity through social media. This made it challenging for citizens to differentiate between accurate and inaccurate information about COVID-19. This motivated us to carry out a comparative study of the characteristics of COVID-19 misinformation versus those of accurate COVID-19 information through a large-scale computational analysis of over 242 million tweets. The study makes comparisons alongside four key aspects: 1) the distribution of topics, 2) the live status of tweets, 3) language analysis and 4) the spreading power over time. An added contribution of this study is the creation of a COVID-19 misinformation classification dataset. Finally, we demonstrate that this new dataset helps improve misinformation classification by more than 9\% based on average F1 measure.

연구 동기 및 목표

  • 소셜 미디어에서 정확한 정보와 오락성 정보 간의 통계적, 언어적 차이를 이해하기 위해.
  • pandemic 기간 동안 오락성 정보 문제를 해결하기 위해 주제 분포, 언어 사용, 확산 동역학에서의 고유한 패턴을 특정하기 위해.
  • 코로나19 오락성 정보를 분류하기 위한 새로운 고품질 데이터셋을 개발하고 검증하여 검출 모델의 성능을 향상시키기 위해.

제안 방법

  • 연구는 신뢰할 수 있는 출처와 关련 키워드를 포함한 커스터마이즈된 목록을 사용하여 트위터 API를 통해 242만 건 이상의 코로나19 관련 트윗을 수집하였다.
  • 새로운 데이터셋을 기반으로 수동 애너테이션과 후처리를 통한 강화를 거친 증거 기반의 새로운 오락성 정보 분류기 모델을 개발하였다.
  • 주제 모델링과 키워드 기반 필터링을 통해 오락성 정보를 음모론, 공적 기관 비판 등 주제 클러스터로 식별하고 분류하였다.
  • Bag-of-Words와 LIWC(Linguistic Inquiry and Word Count)를 사용한 언어 분석을 통해 오락성 정보와 정확한 콘텐츠 간의 감정 톤, 단어 빈도, 의미 범주를 비교하였다.
  • 확산 능력은 리트윗 및 참여 동역학을 시간에 따라 추적하여 지속 기간과 최대 속도를 측정함으로써 평가하였다.
  • 새로운 분류기의 성능은 이심-클레임 아웃 교차검증을 통해 평가되었으며, 이는 이전 최고 수준의 모델 대비 F1 스코어에서 뚜렷한 향상을 보였다.
A Large-Scale Comparative Study of Accurate COVID-19 Information versus Misinformation

실험 결과

연구 질문

  • RQ1정확한 정보와 오락성 정보 간의 주제와 언어 사용에 어떤 차이가 있는가?
  • RQ2소셜 미디어 플랫폼은 어떤 종류의 오락성 정보를 다루었으며, 실제로 오락성 정보가 퍼지는 방식과 비교해보면 어떻게 되는가?
  • RQ3다양한 종류의 오락성 정보는 시간이 지남에 따라 어떤 확산 능력을 보이며, 정확한 정보와 비교해보면 어떠한가?

주요 결과

  • 오락성 정보는 정확한 정보보다 158% 더 빠르게 퍼지며, 음모론 관련 콘텐츠는 초기 게시 후 32시간 이상 활성 상태를 유지하는 가장 긴 확산 지속 기간을 보였다.
  • 음모론 관련 오락성 정보는 전체 오락성 정보의 약 1/3을 차지하며, 플랫폼의 모더레이션 대상으로서 가장 주로 다뤄지며, 이 중 40% 이상이 제거되었다.
  • 바이러스 기원과 관련된 트윗은 플랫폼의 간섭이 가장 적었으며, 게시 후 약 70%가 여전히 접근 가능했다.
  • LIWC를 활용한 언어 분석 결과 오락성 정보는 '분노', '부정적 감정', '죽음' 범주와 강하게 연관되어 있었고, 반면 정확한 정보는 '긍정적 감정', '진정성', '사회' 관련 어휘와 관련되어 있었다.
  • Bag-of-Words 분석을 통해 '#nwoevilplans', '#chinaliedandpeopledied', '#plandemic'와 같은 키워드가 오락성 정보를 강하게 나타내는 것으로 확인되었다.
  • 새로운 데이터셋은 평균 F1 측정치에서 오락성 정보 분류 성능을 9% 이상 향상시켰으며, 기준값 0.51 대비 F1 스코어 0.70을 달성하였다.
Figure 1: (a) : Screenshot of an IFCN debunk post. The post includes 1) fact checking organisation, 2) misinformation claim, 3) explanation of why the claim is false and 4) the link to full debunk article. (b) : Partial screenshot of full debunk article of the IFCN debunk post.
Figure 1: (a) : Screenshot of an IFCN debunk post. The post includes 1) fact checking organisation, 2) misinformation claim, 3) explanation of why the claim is false and 4) the link to full debunk article. (b) : Partial screenshot of full debunk article of the IFCN debunk post.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.