Skip to main content
QUICK REVIEW

[논문 리뷰] MiDe22: An Annotated Multi-Event Tweet Dataset for Misinformation Detection

Çağrı Toraman, Oguzhan Ozcelik|arXiv (Cornell University)|2022. 10. 11.
Misinformation and Its Impacts인용 수 6
한 줄 요약

이 논문은 러시아-우크라이나 전쟁, 코로나19, 난민 위기와 같은 최근 주요 사건들에서 수집한 영어 및 터키어 트윗 10,348건으로 구성된 새로운 다국어 데이터셋 MiDe-22를 소개한다. 이 데이터셋은 가짜, 진실, 기타로 레이블링되었으며, 좋아요, 재트윗, 댓글, 인용 수와 같은 사용자 참여 메타데이터를 포함한다. 최신 기술 모델을 평가한 결과, 영어에서는 DeBERTa가 최대 84.04%의 F1을 기록했고, 터키어에서는 BERTurk가 82.89%를 기록하여 다국어 가짜정보 탐지에서 뛰어난 성능을 보였다.

ABSTRACT

The rapid dissemination of misinformation through online social networks poses a pressing issue with harmful consequences jeopardizing human health, public safety, democracy, and the economy; therefore, urgent action is required to address this problem. In this study, we construct a new human-annotated dataset, called MiDe22, having 5,284 English and 5,064 Turkish tweets with their misinformation labels for several recent events between 2020 and 2022, including the Russia-Ukraine war, COVID-19 pandemic, and Refugees. The dataset includes user engagements with the tweets in terms of likes, replies, retweets, and quotes. We also provide a detailed data analysis with descriptive statistics and the experimental results of a benchmark evaluation for misinformation detection.

연구 동기 및 목표

  • 최근의 다국어 및 참여 정보가 풍부한 가짜정보 탐지 데이터셋이 부족한 문제를 해결하기 위해.
  • 최근의 세계적 사건을 다루며 언어 균형을 고려한 투명하고 윤리적으로 촬영된 데이터셋을 제공함으로써 저자원 언어인 터키어도 포함된다.
  • 다양한 언어와 사건 간의 모델 벤치마킹을 가능하게 하여 다국어 및 다영역 가짜정보 탐지 연구를 지원하기 위해.
  • 정보 확산 동역학을 반영하는 사용자 참여 신호를 포함함으로써 강력한 탐지 시스템 개발을 지원하기 위해.

제안 방법

  • 40개의 사건을 포함한 세 가지 주요 분야(러시아-우크라이나 전쟁, 코로나19, 난민)에 대해 사실 확인 플랫폼(예: Politifact, Teyit.org)을 기반으로 한 타겟팅 쿼리를 사용하여 Twitter Academic Access API를 통해 트윗을 수집하였다.
  • 세부적인 레이블링 가이드라인과 실시간 훈련 세션을 활용하여 전문가들이 트윗을 가짜 정보, 진실 정보, 기타(분류 불가)로 수작업으로 레이블링하였다.
  • 모든 트윗에 대해 좋아요, 댓글, 재트윗, 인용 수와 같은 사용자 참여 데이터를 수집하여 바이러스적 확산 및 참여 패턴 분석을 가능하게 하였다.
  • 기존 기계학습/딥러닝 모델, 다국어 LLM(mBERT, XLM-R), 단일 언어 LLM(DeBERTa, BERTurk)의 세 가지 유형에서 구성된 다면적 벤치마크 평가를 실시하였다.
  • 각 언어별로 5명의 전문가가 참여한 레이블링 과정은 신뢰할 수 있는 사실 확인 자료의 근거를 바탕으로 하여 객관성과 일관성을 확보하였다.
  • 모든 데이터 및 쿠레이션 아티팩트(쿼리, 가이드라인, 도구)는 https://github.com/avaapm/mide22 에 공개되어 재현 가능성과 투명성을 확보하였다.

실험 결과

연구 질문

  • RQ1최근 주요 세계적 사건 동안 다국어 환경(영어 대비 터키어)에서 가짜정보 패턴은 어떻게 다를까?
  • RQ2사용자 참여 신호(좋아요, 재트윗, 댓글, 인용)는 가짜정보 확산 및 탐지 성능과 어느 정도 상관관계가 있는가?
  • RQ3최신 기술 다국어 및 단일 언어 LLM은 새로 촬영된 다국어 가짜정보 탐지 벤치마크에서 어떻게 성능을 보이는가?
  • RQ4한 언어(예: 영어)에서 훈련된 모델은 겹치는 가짜정보 사건에서 저자원 언어(예: 터키어)로 효과적으로 일반화될 수 있는가?
  • RQ5실시간 소셜 미디어 스트림에서 시의적절하고 관련성 있으며 다양한 가짜정보 데이터를 수집하고 레이블링하는 데 있어 주요 과제는 무엇인가?

주요 결과

  • DeBERTa는 MiDe-22의 영어 서브셋에서 84.04%의 최고 F1 스코어를 기록하여 mBERT 및 XLM-R를 포함한 다른 모델을 압도하였다.
  • 터키어에서는 BERTurk가 82.89%의 F1 스코어를 기록하여 저자원 언어의 가짜정보 탐지에서 뛰어난 성능을 보였다.
  • XLM-R는 터키어에서 83.18%의 F1 스코어를 기록하여 저자원 언어임에도 불구하고 강력한 다국어 전이 성능을 보였다.
  • 데이터셋은 사건 유형 간 참여 패턴의 상당한 변동성을 보였으며, 전쟁 및 패닉 관련 가짜정보는 더 높은 재트윗 및 인용 비율을 기록하였다.
  • 참여 메타데이터의 포함은 바이러스적 확산 모델링 잠재력을 크게 향상시켰으며, 주요 사건에서 재트윗과 가짜 주장을 강하게 연관 짓는 것으로 확인되었다.
  • 벤치마크 결과는 특히 DeBERTa와 BERTurk와 같은 미세조정된 LLM이 다국어 가짜정보 탐지에 매우 효과적임을 확인하였으며, 양 언어에서 F1 스코어가 82%를 초과하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.