[論文レビュー] "Liar, Liar Pants on Fire": A New Benchmark Dataset for Fake News Detection
本論文は12.8KのPolitiFact文言を含む liar データセットを導入し、文を話者のメタデータと融合させるハイブリッドCNNを提案して、細分類のフェイクニュース検出で最先端の結果を達成します。
Automatic fake news detection is a challenging problem in deception detection, and it has tremendous real-world political and social impacts. However, statistical approaches to combating fake news has been dramatically limited by the lack of labeled benchmark datasets. In this paper, we present liar: a new, publicly available dataset for fake news detection. We collected a decade-long, 12.8K manually labeled short statements in various contexts from PolitiFact.com, which provides detailed analysis report and links to source documents for each case. This dataset can be used for fact-checking research as well. Notably, this new dataset is an order of magnitude larger than previously largest public fake news datasets of similar type. Empirically, we investigate automatic fake news detection based on surface-level linguistic patterns. We have designed a novel, hybrid convolutional neural network to integrate meta-data with text. We show that this hybrid approach can improve a text-only deep learning model.
研究の動機と目的
- 偽ニュース検出とファクトチェック研究のための大規模で実世界のラベル付きデータセットを提供する。
- 短く、文脈に富む政治的文言を対象に機械学習モデルを評価する。
- テキスト表現と話者/メタデータを統合して検出性能を高めることを探る。
- 表面的な言語特徴だけに依存する多クラスの偽ニュース分類の限界をベンチマークし分析する。
提案手法
- Truthfulness にラベル付けされたPolitiFact文言の12.8Kデータセットをリッチなメタデータとともにキュレーションする。
- ベースラインおよびニューラルモデルにはロジスティック回帰、SVM、Bi-LSTM、テキスト上のCNNを含む。
- テキスト埋め込みとメタデータをメタデータ埋め込み、畳み込み、最大プーリング、Bi-LSTM、最終ソフトマックス分類子を介して統合するハイブリッドConvolutional Neural Networkを提案する。
- テキスト初期化には事前学習済み word2vec(Google News, 300d)を使用する。
- 検証セットでハイパーパラメータを調整し、精度を評価指標として報告する。
- テキストのみのモデルとテキスト+メタデータのハイブリッドアプローチを比較して改善を評価する。
実験結果
リサーチクエスチョン
- RQ1表現的特徴に基づく表面的な言語機能を用いて、6つの細分類真実度カテゴリに短い文言をどれだけ正確に分類できるか?
- RQ2テキストと話者/メタデータを組み合わせるニューラルアーキテクチャは、テキストのみのモデルを上回ることができるか?
- RQ3検出精度に対する異なるメタデータの側面(主題、話者、職業、州、政党、文脈、歴史)の影響はどれくらいか?
主な発見
- liar データセットは6つの細分類の真実ラベル(pants-fire, false, barely-true, half-true, mostly-true, true)を含む12.8K件の文言を含む。
- このデータセットは広範な実世界の文脈を想定しており、各ラベルに対して詳細な正当化とソースリンクを提供する。
- テキストのみのCNNは他のベースラインを上回り(テストセットの精度0.270)、SVMを大幅に上回る(p<0.0001)。
- ハイブリッドなテキスト+メタデータCNNはテキストのみのベースラインを上回り、全メタデータ機能を使用した場合の liar データセットでの最高単一結果は0.274のテスト精度を達成。
- いくつかのメタデータ単一機能モデル(例:Text+Speaker、Text+Job)は、テキストのみモデルを上回る改善を示し、メタデータ統合の利点を示す。
- 全体として、テキストと包括的なメタデータを組み合わせるとテストセットで最も強い性能を発揮する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。