[논문 리뷰] Predicting Misinformation and Engagement in COVID-19 Twitter Discourse in the First Months of the Outbreak
이 연구는 패an드림 초기 기간 동안 약 505,000건의 코로나19 관련 트윗을 분석하여 170개 이상의 특징을 활용해 허위정보와 참여도를 예측한다. 텍스트 내용이 사실과 허위정보를 구분하는 데 가장 중요한 요소로 밝혀졌고, 사용자 메타데이터는 높은 참여도를 예측하는 데에 유용하다. 10개의 분류기에서 F-score가 72% 이상을 기록했으며, 봇은 허위정보를 비율적으로 더 많이 퍼뜨리지만, 허위정보는 사실 정보보다 참여도가 낮다는 점이 확인되었다.
Disinformation entails the purposeful dissemination of falsehoods towards a greater dubious agenda and the chaotic fracturing of a society. The general public has grown aware of the misuse of social media towards these nefarious ends, where even global public health crises have not been immune to misinformation (deceptive content spread without intended malice). In this paper, we examine nearly 505K COVID-19-related tweets from the initial months of the pandemic to understand misinformation as a function of bot-behavior and engagement. Using a correlation-based feature selection method, we selected the 11 most relevant feature subsets among over 170 features to distinguish misinformation from facts, and to predict highly engaging misinformation tweets about COVID-19. We achieved an average F-score of at least 72\% with ten popular multi-class classifiers, reinforcing the relevance of the selected features. We found that (i) real users tweet both facts and misinformation, while bots tweet proportionally more misinformation; (ii) misinformation tweets were less engaging than facts; (iii) the textual content of a tweet was the most important to distinguish fact from misinformation while (iv) user account metadata and human-like activity were most important to predict high engagement in factual and misinformation tweets; and (v) sentiment features were not relevant.
연구 동기 및 목표
- 코로나19 패안드림 초기 단계에서 봇 행동과 사용자 참여도가 허위정보 확산에 미치는 영향를 이해하기 위해.
- 트위터 논의에서 허위정보와 사실 정보를 효과적으로 구분하는 데 가장 중요한 특징을 특정하기 위해.
- 사실 정보이든 허위 정보이든 어떤 트윗이 높은 참여도를 얻을지를 예측하기 위해.
- 감성 특징이 허위정보 식별 및 확산 예측에 얼마나 관련성이 있는지 평가하기 위해.
제안 방법
- 연구는 패안드림 초기 몇 달 동안의 약 505,000건의 코로나19 관련 트윗을 분석한다.
- 상관관계 기반 특징 선택 방법을 통해 170개 이상의 후보 특징 중 11개의 가장 관련성 있는 특징 조합을 선별한다.
- 선택된 특징을 기반으로 10개의 다중 분류기를 훈련 및 평가하여 허위정보 및 높은 참여도를 예측한다.
- 텍스트 내용, 사용자 계정 메타데이터, 행동 패턴(예: 인간과 유사한 활동)을 핵심 예측 변수로 분석한다.
- 모델 성능 평가의 주요 지표로 F-score를 사용한다.
- 감성 특징은 명시적으로 테스트되었으며, 분류 작업 양쪽 모두에서 관련성이 없음을 확인했다.
실험 결과
연구 질문
- RQ1코로나19 패안드림 초기 단계의 트위터 논의에서 어떤 특징가 허위정보와 사실 정보를 가장 잘 구분하는가?
- RQ2봇 행동은 사실 정보와 허위 정보를 퍼뜨릴 때 인간 사용자와 어떻게 다를까?
- RQ3사실 정보나 허위 정보 트윗에서 높은 참여도를 유도하는 요인들은 무엇인가?
- RQ4감성 특징이 허위정보 예측 또는 참여도 예측에 얼마나 기여하는가?
주요 결과
- 실제 사용자들은 사실 정보와 허위 정보 양쪽을 퍼뜨리지만, 봇은 허위정보를 비율적으로 더 많이 공유한다.
- 허위정보 트윗은 사실 트윗보다 참여도가 낮아, 봇에 의해 더 널리 퍼지더라도 확산성이 낮다는 점이 확인되었다.
- 텍스트 내용은 사실과 허위정보를 구분하는 데 가장 중요한 특징이었으며, 메타데이터 및 행동 신호보다 뛰어난 성능을 보였다.
- 사용자 계정 메타데이터와 인간과 유사한 활동 패턴이 높은 참여도를 보이는 트윗을 식별하는 데 가장 예측 능력이 뛰어났다.
- 감성 특징은 허위정보 식별 또는 참여도 예측에 있어 유의미한 관련성이 없었다.
- 선택된 특징 조합 덕분에 10개의 다중 분류기가 둘 다 최소 72%의 평균 F-score를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.