[논문 리뷰] MuMiN: A Large-Scale Multilingual Multimodal Fact-Checked Misinformation Social Network Dataset
MuMiN은 2100만 개의 트윗, 26,000개의 트위터 스레드, 41개의 언어로 된 13,000개의 사실 확인된 주장을 포함한 대규모 다국어 다중모달 사실 확인된 오보 정보 데이터셋을 제공한다. 이 데이터셋은 이질적 그래프로 구조화되어 있으며, 파이썬 패키지(mumin), 기준 모델, 랭킹 보드와 함께 공개되었으며, 진실성 예측 작업에서 최고의 매크로 F1 스코어 62.55%를 기록하였다.
Misinformation is becoming increasingly prevalent on social media and in news articles. It has become so widespread that we require algorithmic assistance utilising machine learning to detect such content. Training these machine learning models require datasets of sufficient scale, diversity and quality. However, datasets in the field of automatic misinformation detection are predominantly monolingual, include a limited amount of modalities and are not of sufficient scale and quality. Addressing this, we develop a data collection and linking system (MuMiN-trawl), to build a public misinformation graph dataset (MuMiN), containing rich social media data (tweets, replies, users, images, articles, hashtags) spanning 21 million tweets belonging to 26 thousand Twitter threads, each of which have been semantically linked to 13 thousand fact-checked claims across dozens of topics, events and domains, in 41 different languages, spanning more than a decade. The dataset is made available as a heterogeneous graph via a Python package (mumin). We provide baseline results for two node classification tasks related to the veracity of a claim involving social media, and demonstrate that these are challenging tasks, with the highest macro-average F1-score being 62.55% and 61.45% for the two tasks, respectively. The MuMiN ecosystem is available at https://mumin-dataset.github.io/, including the data, documentation, tutorials and leaderboards.
연구 동기 및 목표
- 기계 학습 연구 분야에서 오보 정보 탐지에 활용할 수 있는 대규모, 다국어, 다중모달 데이터셋의 부족을 해소하기 위해.
- 기존 데이터셋이 주로 단일 언어, 단일 모달이며 범위와 규모가 제한되어 있는 점을 극복하기 위해.
- 다양한 주제, 영역, 언어적 다양성을 반영함으로써 일반화 가능하고 이벤트에 종속되지 않는 오보 정보 탐지 모델의 훈련을 가능하게 하기 위해.
- 연구자들이 다중모달 및 그래프 기반 오보 정보 탐지 시스템을 벤치마킹할 수 있도록 재현 가능하고 윤리적이며 접근 가능한 데이터 생태계를 제공하기 위해.
- 텍스트, 시각적 자료, 소셜 네트워크 모달성을 통합하여 진실성 예측 성능을 향상시키기 위한 모델 개발을 지원하기 위해.
제안 방법
- 공개된 트위터 데이터를 자동으로 수확하고 트윗을 사실 확인된 주장과 의미적으로 연결하기 위한 데이터 수집 및 연결 시스템인 MuMiN-trawl을 개발하였다.
- 다양한 주제와 영역에서 온 13,000개의 사실 확인된 주장과 연결된 2100만 개의 트윗을 26,000개의 트위터 스레드에서 수집하였다.
- 텍스트(트윗, 기사), 이미지, 사용자 메타데이터, 해시태그, 소셜 네트워크 상호작용(재트윗, 댓글, 인용) 등 다양한 모달성을 통합하였다.
- 비정형 사실 확인 결론을 세 가지 범주로 분류하기 위해 미세조정된 트랜스포머 모델을 사용하였다: 사실, 오보 정보, 기타.
- 이질적 그래프로 데이터셋을 구조화하고, 그래프 기반 기계 학습 프레임워크와의 통합을 위해 mumin 파이썬 패키지를 통해 공개하였다.
- 진술의 진실성과 사실 확인 가능성 예측이라는 두 가지 노드 분류 작업에 대해 텍스트 전용, 이미지 전용, 이질적 그래프 신경망 기반 기준 모델을 구현하였다.
실험 결과
연구 질문
- RQ1대규모, 다국어, 다중모달 데이터셋이 단일 언어나 단일 모달 접근 방식을 초월해 오보 정보 탐지 모델의 일반화 성능을 향상시킬 수 있는가?
- RQ2재트윗, 댓글 등의 소셜 네트워크 구조는 텍스트나 이미지 특징만을 사용할 때보다 진술의 진실성 예측에 얼마나 기여하는가?
- RQ3이질적 그래프 신경망은 다양한 주제와 사건을 아우르는 다중모달 및 다국어 오보 정보 패턴을 얼마나 잘 포착할 수 있는가?
- RQ4현실적이고 대규모이며 다양한 오보 정보 탐지 벤치마크에서 현재의 모델들이 달성할 수 있는 성능의 한계는 어디인가?
- RQ5비영어 오보 정보 주장을 토대로 미세조정할 때 다국어 모델은 번역 기반 접근 방식과 비교해 어떻게 성능을 내는가?
주요 결과
- MuMiN 데이터셋은 41개의 언어로 된 13,000개의 사실 확인된 주장과 연결된 2100만 개의 트윗을 포함하며, 수십 가지 주제에 걸쳐 있다.
- 이 데이터셋은 10년이 넘는 소셜 미디어 활동 기간을 아우르며, 모델 훈련 및 평가에 장기적 관련성과 시간적 다양성을 보장한다.
- 진술의 진실성 예측 작업에서 기록된 최고의 매크로 평균 F1 스코어는 62.55%로, 이 작업의 본질적 난이도를 보여준다.
- 사실 확인 가능성 예측 작업에서 기록된 최고의 매크로 F1 스코어는 61.45%로, 심지어 최첨단 모델이라도 이 복잡한 다중모달 분류 작업에서 어려움을 겪고 있음을 시사한다.
- 결론 분류를 위한 미세조정된 트랜스포머 모델은 테스트 세트에서 높은 성능을 기록했지만, 일부 오분류는 비정형 결론의 복잡성 때문일 가능성이 있다.
- mumin 파이썬 패키지는 효율적인 데이터 컴파일과 표준 그래프 기반 기계 학습 라이브러리로의 내보내기를 가능하게 하여 기존 연구 파이프라인에의 통합을 촉진한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.