Skip to main content
QUICK REVIEW

[論文レビュー] NELA-GT-2022: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles

Maurício Gruppi, Benjamin D. Horne|arXiv (Cornell University)|Mar 10, 2022
Misinformation and Its Impacts被引用数 5
ひとこと要約

NELA-GT-2022 は、2022年1月1日から12月31日までの間に361の報道機関から収集された1,778,361件の英語ニュース記事を含む大規模かつマルチラベル化されたニュースデータセットである。メディアバイアス/フェクトチェック(Media Bias/Fact Check)による機関レベルの真実性ラベルと埋め込み済みのツイートデータを備えており、誤情報、メディアバイアス、および出来事駆動型のメディアナラティブに関する研究を、高い時間的カバレッジと一貫性をもって可能にする。

ABSTRACT

In this paper, we present the fifth installment of the NELA-GT datasets, NELA-GT-2022. The dataset contains 1,778,361 articles from 361 outlets between January 1st, 2022 and December 31st, 2022. Just as in past releases of the dataset, NELA-GT-2022 includes outlet-level veracity labels from Media Bias/Fact Check and tweets embedded in collected news articles. The NELA-GT-2022 dataset can be found at: https://doi.org/10.7910/DVN/AMCV2H

研究の動機と目的

  • 多様な報道機関を対象に、誤情報とメディアの真実性を研究するための包括的で最新かつ一貫して収集されたニュースデータセットを提供すること。
  • 報道機関の行動と出来事駆動型ナラティブの縦断的分析を可能にするために、高い時間的カバレッジとデータの完全性を維持すること。
  • 特にハイブリッドメディアシステムにおいて、ニュース記事に埋め込まれたツイートを含めることで、政治的コミュニケーションに関する研究を支援すること。
  • 一貫した複数年間のデータ収集を通じて、自動誤情報検出モデルの強固な評価を可能にすること。
  • ロシア=ウクライナ戦争や Roe v. Wade の逆転といった2022年の主な出来事のためのイベントベースのサブセットを提供し、焦点を当てた分析を可能にすること。

提案手法

  • ニュース記事は、Python ライブラリの feedparser と Goose3 を用いて、RSSフィードのスクレイピングにより1日2回収集され、データセットに含まれるすべての報道機関のほぼ完全なカバレッジを確保した。
  • 真実性ラベルは Media Bias/Fact Check (MBFC) を用いて割り当てられ、361機関のうち337機関がラベル付けされ、情報源の信頼性に関する多クラス分析が可能になった。
  • ツイートは Goose3 を用いて記事ページから抽出され、ツイートIDと本文が記事メタデータと共に構造化されたデータベースに格納された。
  • 自然言語処理およびテキスト解析の用途を維持しつつ、ニュースの消費を防ぐために、7%のトークンが'@'に置き換えられる形でテキストのオブスクリーションが行われた。
  • データセットは2つの形式で公開された:SQLiteデータベースと、各報道機関ごとのJSONディクショナリであり、アクセスおよびパース用の公開コードも提供された。
  • ロシア=ウクライナ戦争および Roe v. Wade のために、キーワードマッチングを用いてイベントベースのサブセットが作成され、主要出来事の報道状況に関する焦点的な研究が可能になった。

実験結果

リサーチクエスチョン

  • RQ1ロシア=ウクライナ戦争や Roe v. Wade の逆転といった主要な国際的・政治的出来事の報道は、真実性が異なる報道機関間でどのように異なるか?
  • RQ2低真実性のニュース機関は、主な出来事の周囲のナラティブを、埋め込みツイートや記事内容の証拠に基づいて、どれほど拡大または歪曲するか?
  • RQ31年間を通じてデータ収集プロセスはどれほど安定的かつ一貫的であり、記事およびツイートのカバレッジの実際の完全性はどの程度か?
  • RQ4このデータセットは、時間的要因、出来事、および混合真実性ラベルを含む自動誤情報検出モデルの、強固で長期的な評価を可能にするか?
  • RQ5ニュース記事に埋め込まれたツイートは、特にハイブリッドメディア環境において、政治的ナラティブの拡散にどのように寄与するか?

主な発見

  • データセットには361の報道機関から1,778,361件のニュース記事が含まれており、そのうち337の報道機関が Media Bias/Fact Check から真実性ラベルを取得しており、信頼性のある情報源分類が保証されている。
  • 合計346,283件の異なるツイートがニュース記事に埋め込まれており、ソーシャルメディア統合による政治的議論とメディア操作の分析が可能になった。
  • 2022年を通じて、記事の収集プロセスはほぼ完全なカバレッジを達成しており、週次での記事およびツイート数の確認により、最小限の欠落データが確認された。
  • ロシア=ウクライナ戦争および Roe v. Wade のためにキーワードマッチングを用いてイベントベースのサブセットが成功裏に生成され、主要出来事のピーク期にカバレッジが高まった。
  • 完全な NELA-GT コレクションは、5.5年間にわたり610万件以上の記事を含み、複数年の一貫した分析を可能にするため、縦断的研究を支援している。
  • テキストのオブスクリーションにより、分析に適した元のコンテンツの約93%が保持された一方で、ニュースの消費を防止し、倫理的なデータ利用基準を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。