QUICK REVIEW
[論文レビュー] NELA-GT-2018: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles
Jeppe Nørregaard, Benjamin D. Horne|arXiv (Cornell University)|Apr 2, 2019
Misinformation and Its Impacts参考文献 15被引用数 38
ひとこと要約
エンゲージメントに依存しない大規模データセットを紹介。713,534件の英語ニュース記事を194媒体から収集(02/2018–11/2018)、真偽と信頼性のための複数サイトによるグラウンドトゥルースラベルを含む。
ABSTRACT
In this paper, we present a dataset of 713k articles collected between 02/2018-11/2018. These articles are collected directly from 194 news and media outlets including mainstream, hyper-partisan, and conspiracy sources. We incorporate ground truth ratings of the sources from 8 different assessment sites covering multiple dimensions of veracity, including reliability, bias, transparency, adherence to journalistic standards, and consumer trust. The NELA-GT-2018 dataset can be found at https://doi.org/10.7910/DVN/ULHLCB.
研究の動機と目的
- ソーシャルメディアのエンゲージメントとは独立した、誤情報研究のための大規模で多次元のグラウンドトゥルースラベルのギャップを埋める。
- ニュースの真偽と偏りの機械学習および質的研究に適した長期間にわたるデータセットを提供する。
- 複数の評価プラットフォームにわたるソースレベルのグラウンドトゥルースを照合し、多様な分析を可能にする。
提案手法
- 02/2018 から 11/2018 までの間、194のニュース媒体のRSSフィードを1日に2回体系的にクロールして713,534記事を収集した。
- 信頼性、偏り、透明性、信頼の各領域を網羅する八つの評価サイトからソースのグラウンドトゥルースラベルを編纂した。
- 日付、ソース、タイトル、クリーンなテキストを含むSQLiteデータベースに記事データを整理した;ラベルはソースごとにCSVに格納した。
- 8つのグラウンドトゥルースソース(NewsGuard, Pew, Wikipedia, OpenSources, MBFC, AllSides, BuzzFeed News, PolitiFact)とそれらのラベリング方式を比較・記述した。
- 遠隔監視と半教師あり学習のための使用事例ガイダンスを伴う文書化されたデータセットを提供した。
- このデータセットは、グラウンドトゥルース駆動の機械学習と誤情報戦術への混合手法研究を支援することを提案する。
実験結果
リサーチクエスチョン
- RQ1エンゲージメント信号に依存しない大規模で多ラベルのグラウンドトゥルースデータセットが、どのように堅牢な誤情報研究を実現できるか?
- RQ2長期間にわたる多様なニュースソースの間で、真偽と偏見の特性とカバレッジはどのようになっているか?
- RQ3複数の評価サイトからのソースレベルのグラウンドトゥルースを、記事レベルの分析とモデル訓練にどう活用できるか?
主な発見
- 本データセットは02/2018 から 11/2018 の間に収集された194のニュース媒体の記事713,534件を含む。
- グラウンドトゥルースラベルは8つの独立した評価サイトから照合されている。
- ラベルは信頼性、偏り、透明性、信頼など真偽の複数の次元を網羅している。
- 194媒体中40件はクロスサイト照合の後ラベル付けされていない。
- すべての記事は英語で、出典サイトから直接収集され、ソーシャルメディアのエンゲージメントには依存しない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。