Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Claim Identification for Automated Fact Checking

Archita Pathak, Mohammad Abuzar Shaikh|arXiv (Cornell University)|Feb 3, 2021
Misinformation and Its Impacts参考文献 32被引用数 4
ひとこと要約

本稿では、人間によるアノテーションが不要な自己教師ありのアテンションベースのモデル(MA-CIN)を提案し、フェイクニュース記事における「主張に値する」文を、見出しと本文の関連性(aboutness)を活用することで特定する。このモデルは3つのデータセットで優れた性能を示し、自動的事実検証を可能にするために、真正性ラベルと証拠を備えた新しいベンチマークデータセットを導入する。

ABSTRACT

We propose a novel, attention-based self-supervised approach to identify "claim-worthy" sentences in a fake news article, an important first step in automated fact-checking. We leverage "aboutness" of headline and content using attention mechanism for this task. The identified claims can be used for downstream task of claim verification for which we are releasing a benchmark dataset of manually selected compelling articles with veracity labels and associated evidence. This work goes beyond stylistic analysis to identifying content that influences reader belief. Experiments with three datasets show the strength of our model. Data and code available at https://github.com/architapathak/Self-Supervised-ClaimIdentification

研究の動機と目的

  • フェイクニュース記事における主張に値する文を特定するためのスケーラブルでリソースが少ない手法の不足に対処すること。
  • 高価な人間によるアノテーションに依存する従来の教師ありおよび弱教師あり手法の限界を克服すること。
  • 見出しと本文の間の意味的関係(aboutness)を活用することで、影響力があり検証可能な主張を検出する自己教師ありフレームワークを開発すること。
  • フェイクニュース記事の真正性ラベルと支援証拠を手動でラベル付けした新しいベンチマークデータセットを構築し、その後続の事実検証タスクを支援すること。
  • スタイル的ヒントを超えて読者の信念に影響を与えるコンテンツを捉える、スケーラブルで一般化可能な主張検出を実現すること。

提案手法

  • 見出し(クエリ)と各文(ドキュメント)の間のaboutness関係をモデル化する自己教師ありのマルチヘッドアテンションベースのニューラルネットワーク(MA-CIN)を提案する。
  • 見出しと各文の間のアテンション重みを、主張に値する度合いの代理指標とし、高いアテンションスコアは記事の核心的主張に関連するほど高いことを示す。
  • ラベルなしの主張を必要とせず、関連する文に注目し、関連のない文に注目を最小限に抑えるように、対照学習の目的関数を用いてモデルをエンドツーエンドで訓練する。
  • アテンション計算の前段階で、事前学習済みの文埋め込みモデル(例:BERT)を用いて文および見出しの表現を初期化する。
  • 情報検索分野の「aboutness」概念に基づき、見出しと意味的に整合する文に高いアテンションを向けるよう、対照損失関数を適用する。
  • 一般化性能を向上させるために、真正性ラベルと証拠を備えた少量の手動でキュレートされたフェイクニュース記事でモデルをファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1人間によるアノテート済み主張が一切不要な自己教師ありモデルは、フェイクニュースにおける主張に値する文を効果的に特定できるか?
  • RQ2従来の教師ありまたは弱教師あり手法と比較して、アテンション機構は見出しと本文の意味的「aboutness」をどの程度正しく捉えられるか?
  • RQ3本手法は、トピックや構造が異なる多様なフェイクニュースデータセットにどの程度一般化可能か?
  • RQ4トレーニング時にラベルなしの主張が利用可能な場合、本モデルの性能は教師ありベースラインと比べてどうか?
  • RQ5語彙的重複がほとんどない状況でも、モデルは見出しと意味的に関連する主張を検出できるか?

主な発見

  • MA-CINモデルは、トレーニング時に人間によるアノテート済み主張を一切必要とせず、3つの異なるデータセット(DNF_Eval、CDC_Eval、および新しいベンチマーク)で優れた性能を示した。
  • 定性的分析の結果、サンプル記事において人間が評価した上位5件の主張のうち3件を正しく特定しており、意味的関連性において人間の判断と強い整合性を示した。
  • モデルは意味的aboutnessを正しく捉えている:意味が一致しない文(例:文1は語彙は共有するが意味は異なる)には低アテンションを、意味的に整合性のある主張(例:文2、12、13)には高アテンションを割り当てた。
  • アテンションパターンから、モデルが関連する文(例:文3〜8は物語的連鎖を形成)をグループ化し、同じ文への自己アテンションを回避していることが明らかになった。これは、堅牢な推論能力を示している。
  • モデルは、アノテータの合意を超えて、一部の文(例:文3や4)を関連性があると特定している。これは、アノテータの合意を超えた主張検出の可能性を示唆している。
  • 人間によるアノテーションデータに含まれる主観的バイアスに対しても、モデルのアテンションパターンが複数の評価ケースで一貫しており、性能の安定性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。