Skip to main content
QUICK REVIEW

[논문 리뷰] AraCOVID19-MFH: Arabic COVID-19 Multi-label Fake News and Hate Speech Detection Dataset

Mohamed Seghir Hadj Ameur, Hassina Aliane|arXiv (Cornell University)|2021. 05. 07.
Misinformation and Its Impacts참고 문헌 29인용 수 14
한 줄 요약

이 논문은 10개의 차원(가짜 뉴스, 혐오 발언, 사실성, 방언 등)에 걸쳐 레이블링된 10,828개의 아랍어 트윗을 포함한 수작업으로 레이블링된 다중 레이블 데이터셋 AraCOVID19-MFH를 소개한다. 특히 아랍어 코로나19 트윗으로 미리 훈련된 AraBERT 및 mBERT와 같은 트랜스포머 모델을 미세조정한 결과, 핵심 과제에서 0.98 이상의 가중 F-스코어를 기록하여 다국어 가짜 정보 탐지 분야에서 이 데이터셋의 유용성을 입증한다.

ABSTRACT

Along with the COVID-19 pandemic, an "infodemic" of false and misleading information has emerged and has complicated the COVID-19 response efforts. Social networking sites such as Facebook and Twitter have contributed largely to the spread of rumors, conspiracy theories, hate, xenophobia, racism, and prejudice. To combat the spread of fake news, researchers around the world have and are still making considerable efforts to build and share COVID-19 related research articles, models, and datasets. This paper releases "AraCOVID19-MFH" a manually annotated multi-label Arabic COVID-19 fake news and hate speech detection dataset. Our dataset contains 10,828 Arabic tweets annotated with 10 different labels. The labels have been designed to consider some aspects relevant to the fact-checking task, such as the tweet's check worthiness, positivity/negativity, and factuality. To confirm our annotated dataset's practical utility, we used it to train and evaluate several classification models and reported the obtained results. Though the dataset is mainly designed for fake news detection, it can also be used for hate speech detection, opinion/news classification, dialect identification, and many other tasks.

연구 동기 및 목표

  • 코로나19 기간 동안 가짜 정보 및 혐오 발언을 탐지하기 위한 대규모 고품질 아랍어 언어 데이터셋의 부족을 해결하기 위해.
  • 사실성, 감성, 방언, 확인 가치 등 트윗 콘텐츠의 다중 차원을 포괄하는 풍부한 레이블링 데이터셋을 구축하기 위해.
  • 가짜 뉴스 탐지 외의 작업, 예를 들어 혐오 발언 탐지, 의견 분류, 방언 식별 등 아랍어 NLP 연구를 가능하게 하기 위해.
  • 다양한 트랜스포머 기반 모델을 미세조정하고 작업 전용 미리 훈련을 수행하여 데이터셋의 유용성을 검증하기 위해.

제안 방법

  • 10,828개의 트위터 아랍어 트윗을 수작업으로 레이블링하여 데이터셋을 구축하였으며, 다양한 아랍어 방언과 코로나19 패닉과 관련된 주제를 포함한다.
  • 각 트윗은 '가짜 정보 포함', '사실적', '혐오', '비난 및 부정적 발언', '확인 가치 있음', '방언' 등 10개의 다중 레이블 카테고리로 레이블링되었다.
  • 인간 레이블러들이 레이블 일관성을 확보하였으며, 상호 레이블러 간 일致도를 측정하여 품질을 검증하였다.
  • AraBERT, mBERT, DistilBERT와 같은 사전 훈련된 트랜스포머 모델을 5겹 교차 검증 전략을 사용하여 데이터셋에 대해 미세조정하였다.
  • 도메인 특화 언어에 대한 성능 향상을 위해 150만 개의 아랍어 코로나19 트윗으로 추가 미리 훈련을 수행하였다.
  • 모델 평가에서는 모든 10개 레이블에 대해 가중 F-스코어를 사용하였으며, 미세조정 및 미리 훈련 효과를 비교하기 위한 분석 연구를 실시하였다.

실험 결과

연구 질문

  • RQ1AraCOVID19-MFH 데이터셋은 코로나19 아랍어 트윗의 다중 차원에 걸친 정확한 다중 레이블 분류를 위해 얼마나 효과적인가?
  • RQ2냉각된 가중치를 사용하는 것과 비교해, 트랜스포머 가중치를 미세조정하는 것이 이 데이터셋에서 분류 성능을 얼마나 향상시키는가?
  • RQ3아랍어 코로나19 트윗으로 추가로 미리 훈련하는 것은 AraBERT 및 mBERT의 후행 분류 과제에서 성능을 얼마나 향상시키는가?
  • RQ4이 데이터셋은 가짜 뉴스 탐지 외에도 혐오 발언 탐지 및 방언 식별과 같은 과제를 지원할 수 있는가?
  • RQ5도메인 특화 미리 훈련은 저자원 언어 모델의 가짜 정보 탐지에 어떤 영향을 미치는가?

주요 결과

  • AraCOVID19-MFH 데이터셋에 대해 트랜스포머 모델을 미세조정함으로써 성능 향상이 크게 이루어졌으며, 모든 과제에서 F-스코어가 0.1에서 0.5 범위로 향상되었다.
  • 도메인 특화 아랍어 코로나19 트윗으로 미세조정된 AraBERT 및 mBERT 모델이 가장 높은 성능을 기록하였으며, '혐오 포함' 및 '치료법에 대해 논의' 과제에서 가중 F-스코어가 0.98를 초과하였다.
  • 가장 뛰어난 성능을 보인 모델인 AraBERT COVID-19는 '혐오 포함' 레이블에서 가중 F-스코어 0.9858, '치료법에 대해 논의' 레이블에서 0.9930을 기록하였다.
  • 미세조정 없이도 아랍어 코로나19 데이터로 사전 훈련된 모델이 베이스라인 모델을 능가하는 성능을 보여, 도메인 특화 사전 훈련의 가치를 입증하였다.
  • 다중 레이블 스키마가 효과적임을 입증하였으며, '가짜 정보 포함'과 같은 도전적인 레이블조차도 미세조정 시 F-스코어 0.9491을 기록하여 모든 10개 레이블에서 높은 F-스코어를 달성하였다.
  • 결과적으로 고품질 수작업 레이블링과 목표 지향적 사전 훈련의 조합이 아랍어 가짜 정보 탐지에서 모델 성능을 크게 향상시킨다는 점을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.