Skip to main content
QUICK REVIEW

[論文レビュー] A Coarse-to-fine Cascaded Evidence-Distillation Neural Network for Explainable Fake News Detection

Zhiwei Yang, Jing Ma|arXiv (Cornell University)|Sep 29, 2022
Misinformation and Its Impacts被引用数 10
ひとこと要約

本稿では、手動での事実確認に依存せずに、生のレポートからフェイクニュースを検出するとともに、妥当性の説明を直接生成する、粗くから細かくまでの段階的証拠精錬ニューラルネットワークであるCofCEDを提案する。主張の関連性、情報量、顕著性、重複のなさといった特徴を活用することで、新しく構築された2つのデータセットにおいて、最先端のベースラインを上回り、高い検出精度に加え、多様な証拠ソースからの高品質で解釈可能な説明を達成する。

ABSTRACT

Existing fake news detection methods aim to classify a piece of news as true or false and provide veracity explanations, achieving remarkable performances. However, they often tailor automated solutions on manual fact-checked reports, suffering from limited news coverage and debunking delays. When a piece of news has not yet been fact-checked or debunked, certain amounts of relevant raw reports are usually disseminated on various media outlets, containing the wisdom of crowds to verify the news claim and explain its verdict. In this paper, we propose a novel Coarse-to-fine Cascaded Evidence-Distillation (CofCED) neural network for explainable fake news detection based on such raw reports, alleviating the dependency on fact-checked ones. Specifically, we first utilize a hierarchical encoder for web text representation, and then develop two cascaded selectors to select the most explainable sentences for verdicts on top of the selected top-K reports in a coarse-to-fine manner. Besides, we construct two explainable fake news datasets, which are publicly available. Experimental results demonstrate that our model significantly outperforms state-of-the-art baselines and generates high-quality explanations from diverse evaluation perspectives.

研究の動機と目的

  • 既存のフェイクニュース検出手法が手動での事実確認済みレポートに強く依存しているという限界に対処すること。これはカバレッジが限定的で遅延が生じるためである。
  • 生のマスコミレポートからの「群衆の知恵」を活用する汎用的で説明可能なフェイクニュース検出フレームワークを構築すること。
  • 主張の関連性、情報量、顕著性、重複のなさという4つの主要な特徴を明示的にモデル化することで、高品質で意味的に整合性のある説明を生成すること。
  • 各ニュース主張に対して生のレポートを含む、現実的で公開可能な2つのデータセット(RAWFCおよびLIAR-RAW)を構築すること。
  • 生のレポートから精錬された証拠が、妥当性予測および説明生成の両面で最先端の性能を達成できることを実証すること。

提案手法

  • 生のレポートからのウェブテキストを表現するために階層的エンコーダーを用い、文レベルおよびドキュメントレベルの意味を捉える。
  • 粗くから細かくまでの段階的アプローチで、2段階の選別器を設計:まず、検証価値の高い上位K件のレポートを選択し、次にそれらから説明に適した文を精錬する。
  • 主張の関連性(文が主張をどの程度支持するか)、情報量(情報密度)、顕著性(予測に対する重要性)、重複のなさ(文間での一意性)という4つの意味的特徴を明示的に最適化する。
  • マルチタスク適応的重み付け(MAW)機構により、妥当性予測と説明生成のトレードオフを動的にバランスさせ、手動によるグリッドサーチの必要性を排除する。
  • モデルはソフトスレッショルド機構(ε)を用い、文の総数に基づいて各レポートあたりの関連文の数を自動で決定する。
  • 妥当性分類と説明生成の両方を統合的に最適化するジョイント目的関数により、エンドツーエンドで訓練することで、相互に強化を図る。

実験結果

リサーチクエスチョン

  • RQ1事実確認済みの記事に依存せずに、生のレポートのみを用いて神経ネットワークがフェイクニュースを効果的に検出し、正確で解釈可能な説明を生成できるか?
  • RQ2主張の関連性、文の情報量、顕著性、重複のなさという特徴が、説明生成のための高品質な証拠文を選択する上で、それぞれどのように寄与するか?
  • RQ31段階のベースラインと比較して、粗くから細かくまでの段階的選別機構が、説明品質および検出精度をどの程度向上させるか?
  • RQ4提案されたマルチタスク適応的重み付け(MAW)機構は、固定値またはグリッドサーチによるトレードオフ戦略と比較して、説明と検出性能のバランスをどのように上回るか?
  • RQ5モデルは、細分化された妥当性ラベルにおいて語の重複が少ない現実世界の主張に対しても、一般化して適応可能か?

主な発見

  • CofCEDは、RAWFCおよびLIAR-RAWの両データセットにおいて、妥当性予測の面で最先端のベースラインを顕著に上回り、優れた検出性能を示した。
  • 人間の評価において、モデルが生成する説明は、一貫して正確で解釈可能であると評価された。
  • アブレーションスタディの結果、関連性、情報量、顕著性、重複のなさという4つの特徴すべてが説明品質に有意に寄与しており、特に重複のなさが低価値な文を効果的にフィルタリングする上で顕著に効果的であった。
  • マルチタスク適応的重み付け(MAW)機構は、固定値またはグリッドサーチによる重み付けよりも優れた性能を示し、手動チューニングなしに説明と検出の両方の目的を一貫してバランスさせた。
  • RAWFCでは12件、LIAR-RAWでは18件のレポートを選択した際にモデルの性能が最も良く、最適なレポート選択はデータセットに依存し、レポート数の変動に敏感であることが示された。
  • ケーススタディでは、モデルの注目が誤った主張を反証する証拠文と正しく一致していることが確認され、特徴スコアの可視化により分類意思決定の主な要因が明確に特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。