[論文レビュー] NELA-GT-2019: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles
本論文は、2019年1月から2019年12月にかけて発行された260のニュースソースからなる112万件の英語ニュース記事を含む大規模かつマルチラベル付きのニュースデータセット、NELA-GT-2019を紹介する。このデータセットは、メディアバイアス/ファクトチェック、AllSides、PolitiFactを含む7つの評価サイトからのソースレベルの真実性ラベルを統合しており、信頼性(信頼できる、混合、信頼できない)の3クラスの集約ラベルを新たに追加することで、誤情報、コンセプトドリフト、および時間経過に伴う偽情報戦術に関する強固な研究を可能にする。
In this paper, we present an updated version of the NELA-GT-2019 dataset, entitled NELA-GT-2020. NELA-GT-2020 contains nearly 1.8M news articles from 519 sources collected between January 1st, 2020 and December 31st, 2020. Just as with NELA-GT-2018 and NELA-GT-2019, these sources come from a wide range of mainstream news sources and alternative news sources. Included in the dataset are source-level ground truth labels from Media Bias/Fact Check (MBFC) covering multiple dimensions of veracity. Additionally, new in the 2020 dataset are the Tweets embedded in the collected news articles, adding an extra layer of information to the data. The NELA-GT-2020 dataset can be found at https://doi.org/10.7910/DVN/CHMUYZ.
研究の動機と目的
- 誤情報研究のための、大規模かつタイムリーでマルチラベル付きのニュースデータセットの不足を解消すること。
- NELA-GT-2018データセットに66の新規ソースと40万件の追加記事を追加し、12か月間の完全な期間をカバーすること。
- データセットの拡張にもかかわらず、各ソースに高いラベル密度を維持することで、モデル学習および分析のための信頼できる真のラベルを確保すること。
- 最新の公開可能なデータフォーマット(SQLiteおよびJSON)と抽出スクリプトを提供し、研究分野全体での利用可能性を高めること。
- 誤情報の長期的動態、半教師あり学習、およびニュースメディアにおける進化する偽情報戦術に関する研究を支援すること。
提案手法
- Pythonのライブラリであるfeedparserとgooseを用いた自動RSSフィードスクレイピングにより、260のニュースソースから1日2回ずつデータ収集を実施した。
- メディアバイアス/ファクトチェック(MBFC)、Allsides、PolitiFactを含む7つの外部評価サイトからのソースレベルのラベルを統合し、政治的傾向、事実性、バイアスをカバーした。
- MBFCのソースタイプと事実性スコアを用いて、新たな3クラスの集約信頼性ラベルを生成した:信頼できない(陰謀論・偽科学、または極めて低い事実性)、混合(事実性が混合)、信頼できる(高いまたは非常に高い事実性)。
- データセットは、柔軟なデータアクセスを可能にするために、構造化されたSQLiteデータベースと、各ニュースソースごとのJSONディクショナリの2つのフォーマットでリリースされた。
- 両フォーマットからのデータ抽出を容易にするPythonスクリプトを開発し、研究者による再現性と利用可能性を向上させた。
- データ収集の安定化を図り、NELA-GT-2018の10か月間のカバー期間を上回る12か月間の継続的カバーを実現した。
実験結果
リサーチクエスチョン
- RQ1コンセプトドリフトの影響により、ニュースの真実性検出におけるモデル性能は時間経過とともにどのように変化するか。長期的かつ一貫性のあるデータを用いることで、この問題を解明できるか。
- RQ2大規模なニュースデータセットに含まれるラベルなしまたは混合真実性のソースは、誤情報検出のための半教師あり学習フレームワークで効果的に活用できるか。
- RQ3異なる政治的出来事や時間経過に伴い、偽情報戦術やソース行動はどのように変化するか。
- RQ4主要なニュースイベントをめぐって、政治的ナラティブとソースの信頼性分類は12か月間にわたりどのように変化するか。
- RQ5単一ラベルアプローチと比較して、集約されたソースレベルのラベルは、誤情報検出モデルのロバスト性をどの程度向上させられるか。
主な発見
- NELA-GT-2019は、2019年1月から12月までの12か月間にわたり収集された260のソースからなる112万件のニュース記事を含み、NELA-GT-2018に比べ40万件の増加を記録した。
- データセットの79%のソースが7つの評価サイトの少なくとも1つのラベルを有しており、76%がメディアバイアス/ファクトチェック(MBFC)のラベルを有しており、拡張にもかかわらず高いラベル密度を維持している。
- MBFCのソースタイプと事実性スコアを基に導出された新しい3クラスの集約信頼性ラベルを含んでおり、ソース信頼性のより洗練された分析を可能にしている。
- 利用規約の変更と課金制モデルの影響により、NewsGuardのラベルは除外された。今後は7つの代替評価ソースに依存することになった。
- SQLiteおよびJSONという現代的なフォーマットで提供され、即時に利用可能なPythonスクリプトを備えており、アクセス性と再現性が向上した。
- NELA-GT-2018およびNELA-2017と組み合わせることで、2.5年間にわたる一貫性のあるニュースデータセットを構築可能となり、誤情報およびメディア信頼性の時間的ダイナミクスを研究するための支援が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。