Skip to main content
QUICK REVIEW

[論文レビュー] FakeCovid -- A Multilingual Cross-domain Fact Check News Dataset for COVID-19

Gautam Kishore Shahi, Durgesh Nandini|arXiv (Cornell University)|Jun 19, 2020
Misinformation and Its Impacts被引用数 77
ひとこと要約

FakeCovid を紹介する、多言語・跨ドメインのデータセットで、5,182 の事実確認済み COVID-19 記事を 92 サイト、40 言語、105 国にまたがって収集し、偽情報検出の F1 が 0.76 となるベースライン分類器を提供する。

ABSTRACT

In this paper, we present a first multilingual cross-domain dataset of 5182 fact-checked news articles for COVID-19, collected from 04/01/2020 to 15/05/2020. We have collected the fact-checked articles from 92 different fact-checking websites after obtaining references from Poynter and Snopes. We have manually annotated articles into 11 different categories of the fact-checked news according to their content. The dataset is in 40 languages from 105 countries. We have built a classifier to detect fake news and present results for the automatic fake news detection and its class. Our model achieves an F1 score of 0.76 to detect the false class and other fact check articles. The FakeCovid dataset is available at Github.

研究の動機と目的

  • 複数のドメインとソースから、巨大な多言語の事実確認済み COVID-19 ニュースデータセットを作成する。
  • 記事を内容ベースのカテゴリに注釈付けし、跨ドメイン分析を可能にする。
  • 言語横断の自動偽情報検出のベースラインモデルを提供する。
  • COVID-19 の誤情報の跨言語・跨国特性の分析を可能にする。

提案手法

  • 92 のファクトチェックサイトから 5,182 件の事実確認済み COVID-19 記事を収集する。
  • Poynter および Snopes のソースを参照して記事を精選する(04/01/2020–15/05/2020)。
  • 記事を手動で 11 の内容カテゴリに注釈付けする。
  • 40 言語および 105 国に渡る多言語カバーを保証する。
  • 偽ニュースを検出する分類器を訓練し、false クラスおよび他の事実確認クラスでの性能を報告する。

実験結果

リサーチクエスチョン

  • RQ1多言語・跨ドメインの COVID-19 事実確認ニュースデータセットは、言語や国ごとにどのように分布しているか。
  • RQ2このデータセットで訓練された分類器は、言語を超えて偽情報を他の事実確認コンテンツと効果的に区別できるか。
  • RQ3言語とドメインを超えて、11 の内容カテゴリの分布と特徴はどうなるか。

主な発見

  • データセットには 5,182 件の事実確認済み COVID-19 記事が含まれる。
  • 記事は 92 のファクトチェックサイトから来ている。
  • データは 40 言語・105 国をカバーしている。
  • FakeCovid で訓練された分類器は、false クラスおよび他の事実確認記事の検出に対して F1 スコア 0.76 を達成している。
  • データセットは公開用として GitHub で利用可能。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。