Skip to main content
QUICK REVIEW

[論文レビュー] On the Benefit of Combining Neural, Statistical and External Features for Fake News Identification

Gaurav Bhatt, Aman Sharma|arXiv (Cornell University)|Dec 11, 2017
Misinformation and Its Impacts参考文献 21被引用数 18
ひとこと要約

本論文は、スキップ・スコップ文埋め込み、TF-IDF重み付きn-gram特徴量、および手作業で作成した外部特徴量を統合するハイブリッドモデルを提案し、フェイクニュースのスタンス検出を向上させることを目的としている。ニューラル特徴量、統計特徴量、ヒューリスティック特徴量を深層ニューラルネットワークを用いて統合することで、FNC-1データセットにおいて最先端の性能を達成し、全体のFNCスコアは89.29、『議論』スタンスでは85.68%、『関連なし』スタンスでは98.04%の優れた正確性を達成した。

ABSTRACT

Identifying the veracity of a news article is an interesting problem while automating this process can be a challenging task. Detection of a news article as fake is still an open question as it is contingent on many factors which the current state-of-the-art models fail to incorporate. In this paper, we explore a subtask to fake news identification, and that is stance detection. Given a news article, the task is to determine the relevance of the body and its claim. We present a novel idea that combines the neural, statistical and external features to provide an efficient solution to this problem. We compute the neural embedding from the deep recurrent model, statistical features from the weighted n-gram bag-of-words model and handcrafted external features with the help of feature engineering heuristics. Finally, using deep neural layer all the features are combined, thereby classifying the headline-body news pair as agree, disagree, discuss, or unrelated. We compare our proposed technique with the current state-of-the-art models on the fake news challenge dataset. Through extensive experiments, we find that the proposed model outperforms all the state-of-the-art techniques including the submissions to the fake news challenge.

研究の動機と目的

  • ヘッドラインとニュース本文間のスタンス検出に焦点を当てることで、フェイクニュース同定の課題に取り組む。
  • ニューラル特徴量、統計特徴量、外部特徴量を統合することで、フェイクニューススタンス分類の性能が向上するかどうかを調査する。
  • 特に『反対』スタンスカテゴリにおいて、データセットの不均衡に起因するディープラーニングモデルの限界を克服する。
  • 複数の特徴タイプを活用することで、一般化性能と正確性を向上させる、強固なハイブリッドモデルを構築する。
  • マルチモーダル特徴統合戦略を用いて、FNC-1ベンチマークデータセットで既存の最先端モデルを上回る性能を発揮する。

提案手法

  • ヘッドラインおよびニュース本文の両方に対して、コンテキストに即した密な文埋め込みを生成するために、スキップ・スコップベクトルを用いる。
  • テキストコンテンツから統計的特徴量を抽出するために、TF-IDF重み付きn-gramのバッグ・オブ・ワーズ表現を適用する。
  • ヘッドラインと本文間の語の重複、コサイン類似度、n-gramマッチングなどの、手作業で作成した外部特徴量を統合する。
  • ニューラル特徴量、統計特徴量、外部特徴量を統合し、エンドツーエンド分類を実現する統一された深層ニューラルネットワークに統合する。
  • 4つのカテゴリ(賛成、反対、議論、関連なし)に分類するため、深層フィードフォワードネットワークを用いる。
  • 公式のFNCスコアとクラスごとの正確性を評価指標として用い、FNC-1データセット上でモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1ニューラル特徴量、統計特徴量、外部特徴量の統合が、フェイクニュースデータセットにおけるスタンス検出性能を向上させることができるか?
  • RQ2提案されたハイブリッドモデルは、FNC-1ベンチマーク上で既存の最先端のディープラーニングアーキテクチャと比較してどのように差をつけるか?
  • RQ3既存のモデルが『反対』スタンスで性能を発揮できない理由は何か?また、特徴工学がこの問題を緩和できるか?
  • RQ4スキップ・スコップ埋め込みとTF-IDF n-gram、ヒューリスティック特徴量を統合することで、不均衡データに対してより良い一般化性能が得られるか?
  • RQ5外部特徴量が『関連なし』および『議論』スタンスにおける性能向上にどの程度寄与しているか?

主な発見

  • 提案モデルは、FNC-1チャレンジの上位提出物を含む、すべての最先端モデルを上回る全体のFNCスコア89.29を達成した。
  • 『議論』スタンスでは85.68%の最高クラス正確性を達成し、他のモデルを大きく上回った。
  • 『関連なし』スタンスでは98.04%の正確性を達成し、この困難なカテゴリにおける強力な一般化性能を示した。
  • 1つの上位提出物よりわずかに全体正確性が低かったが、FNCスコアが高かったため、全スタンスにわたるバランスの良さが優れていた。
  • 混同行列から、『賛成』(43.82%)および『反対』(6.31%)の両方で良好な性能が得られており、特に『反対』は多くのモデルが困難としている。
  • 本モデルの成功は、スキップ・スコップ埋め込み、TF-IDF n-gram、手作業で作成した特徴量の有効な統合に起因し、データの不均衡やモデルバイアスを補償している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。