[논문 리뷰] CMU-MisCov19: A Novel Twitter Dataset for Characterizing COVID-19 Misinformation
이 논문은 코로나19 위기 정보 오남용 현상을 연구하기 위해 대규모로 수작업으로 분류된 트위터 데이터셋인 CMU-MisCov19를 소개한다. 이 데이터셋은 거짓 정보를 퍼뜨리는 오인된 사용자들과 이를 바로잡는 정보가 풍부한 사용자들 간의 경쟁적 온라인 커뮤니티를 분석하는 데 목적이 있다. 네트워크 분석, 사회언어학적 모델링, 봇 탐지 기법을 통해 연구한 결과, 오남용 정보 커뮤니티는 더 두꺼운 밀도를 보이며 더 조직적이고, 더 높은 비율의 봇을 포함하고 있음을 확인했으며, 이는 조작된 정보 확산 캠페인을 시사한다. 반면 정보가 풍부한 사용자들은 거짓 정보를 바로잡기 위해 서사적 프레임워크를 더 많이 활용한다.
From conspiracy theories to fake cures and fake treatments, COVID-19 has become a hot-bed for the spread of misinformation online. It is more important than ever to identify methods to debunk and correct false information online. Detection and characterization of misinformation requires an availability of annotated datasets. Most of the published COVID-19 Twitter datasets are generic, lack annotations or labels, employ automated annotations using transfer learning or semi-supervised methods, or are not specifically designed for misinformation. Annotated datasets are either only focused on "fake news", are small in size, or have less diversity in terms of classes. Here, we present a novel Twitter misinformation dataset called <strong>"CMU-MisCov19"</strong> with 4573 annotated tweets over 17 themes around the COVID-19 discourse. We also present our annotation codebook for the different COVID-19 themes on Twitter, along with their descriptions and examples, for the community to use for collecting further annotations. Further details related to the dataset, and our analysis based on this dataset can be found at https://arxiv.org/abs/2008.00791. In adherence to the Twitter’s terms and conditions, we do not provide the full tweet JSONs but provide a ".csv" file with the tweet IDs so that the tweets can be rehydrated. We also provide the annotations, and the date of creation for each tweet for the reproduction of the results of our analyses. <strong>Note: If for any reason, you are not able to rehydrate all the tweets, reach out to Shahan Ali Memon at (shahan@nyu.edu).</strong> If you use this data, please cite our paper as follows: <em>"Shahan Ali Memon and Kathleen M. Carley. Characterizing COVID-19 Misinformation Communities Using a Novel Twitter Dataset, In Proceedings of The 5th International Workshop on Mining Actionable Insights from Social Networks (MAISoN 2020), co-located with CIKM, virtual event due to COVID-19, 2020."</em>
연구 동기 및 목표
- 공개 연구를 위해 코로나19 위기 오남용에 초점을 맞춘 다양한 수작업 분류된 트위터 데이터셋을 수집하고 배포하기.
- 팬데믹 기간 동안 오인된 사용자들과 정보가 풍부한 사용자들 간의 커뮤니티 구조적, 언어적, 행동적 차이를 규명하기.
- 특히 반백신 네트워크 내에서 오남용 정보를 확산시키는 데 봇과 커뮤니티 소속이 어떤 역할을 하는지 조사하기.
- 직접 반박하는 방식보다 서사 기반 커뮤니케이션이 오남용 정보를 바로잡는 데 더 효과적인지 평가하기.
제안 방법
- 2020년 3월 29일, 6월 15일, 6월 24일(연속되지 않은 3일) 동안 키워드 기반 검색 API를 사용해 트위터 데이터를 수집하였으며, 오남용 주제와 관련된 용어에 집중하였다.
- 오남용 유형, 입장, 언어적 특징 등을 포함한 다층적 분류 체계를 사용해 트윗을 수작업으로 분류하였다.
- 재트윗, 언급, 응답을 기반으로 사용자 수준의 네트워크를 구축하여 커뮤니티 구조 및 중심성 지표를 분석하였다.
- 신뢰도 기준이 0.75 이상인 사전 훈련된 봇 탐지 모델(Bot-Hunter)을 적용하여 자동화된 계정을 식별하였다.
- 자연어처리 기법을 활용해 정서적 톤과 서사 사용 패턴을 비교 분석함으로써 사회언어학적 분석을 수행하였다.
- 반백신 및 기타 건강 관련 오남용 네트워크를 포함한 여러 오남용 하위 커뮤니티 간 사용자 소속 관계를 매핑하였다.
실험 결과
연구 질문
- RQ1오인된 사용자들과 정보가 풍부한 사용자들의 코로나19 트위터 커뮤니티 네트워크 구조는 밀도와 중심성 측면에서 어떻게 다를까?
- RQ2특히 서사 사용과 정서적 톤 측면에서 정보가 풍부한 사용자들과 오인된 사용자들을 구분하는 언어 패턴은 무엇인가?
- RQ3오남용 커뮤니티 내에서 봇의 비율은 어느 정도이며, 이들의 존재는 조작된 오남용 정보 캠페인을 시사하는가?
- RQ4오인된 사용자들은 반백신 커뮤니티에 비해 특히 더 높은 비율로 소속되어 있는가?
- RQ5직접 반박하는 방식보다 서사 기반 커뮤니케이션이 오남용 정보를 바로잡는 데 더 효과적인가?
주요 결과
- 오인된 커뮤니티는 정보가 풍부한 커뮤니티보다 유의미하게 더 높은 네트워크 밀도를 보이며, 더 두껍고 유기적으로 조직되어 있음을 시사한다.
- 오인된 커뮤니티 내에서 봇 비율이 유의미하게 높다(p < 0.05), 이는 조직적인 오남용 정보 캠페인을 시사한다.
- 오인된 사용자 대부분이 반백신 커뮤니티에 소속되어 있어, 반백신 네트워크와 광범위한 오남용 네트워크 간의 강한 겹침을 보여준다.
- 정보가 풍부한 사용자들은 오인된 사용자들보다 유의미하게 더 많은 서사적 요소를 사용하며, 오인된 사용자들은 더 많은 기명적 또는 음모론적 진술에 의존한다.
- 양측 커뮤니티 모두 부정적인 정서적 톤을 보이지만, 정보가 풍부한 사용자들이 서사를 더 많이 활용하는 것은 전략적 커뮤니케이션 접근 방식일 수 있다.
- 일반적인 반박 메시지가 보편적으로 효과가 있다는 가정을 도전하며, 맞춤형 서사 기반 개입 전략이 필요할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.