Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Fact-checkers: Analysis and Generation of Fact-checking Language

Nguyen D. Vo, Kyumin Lee|arXiv (Cornell University)|Oct 4, 2019
Misinformation and Its Impacts被引用数 7
ひとこと要約

本稿では、オンラインディスcourseにおける誤情報の事実確認応答(FCツイート)を生成する深層学習フレームワークを提案する。64,110件のオリジナルツイートと関連する事実確認返信から構成される独自のデータセットを用い、二重教師知識蒸留法(FCRG-DT)を採用したシーケンス・ツー・シーケンスモデルを訓練した。このモデルは、関連性においてベースラインを最大30%上回り、より形式的で事実に基づいた応答を生成し、誤情報の拡散を効果的に抑制する。

ABSTRACT

In fighting against fake news, many fact-checking systems comprised of human-based fact-checking sites (e.g., snopes.com and politifact.com) and automatic detection systems have been developed in recent years. However, online users still keep sharing fake news even when it has been debunked. It means that early fake news detection may be insufficient and we need another complementary approach to mitigate the spread of misinformation. In this paper, we introduce a novel application of text generation for combating fake news. In particular, we (1) leverage online users named \\emph{fact-checkers}, who cite fact-checking sites as credible evidences to fact-check information in public discourse; (2) analyze linguistic characteristics of fact-checking tweets; and (3) propose and build a deep learning framework to generate responses with fact-checking intention to increase the fact-checkers' engagement in fact-checking activities. Our analysis reveals that the fact-checkers tend to refute misinformation and use formal language (e.g. few swear words and Internet slangs). Our framework successfully generates relevant responses, and outperforms competing models by achieving up to 30\\% improvements. Our qualitative study also confirms that the superiority of our generated responses compared with responses generated from the existing models.

研究の動機と目的

  • 既存の事実確認システムにもかかわらず誤情報が根強く広がり続ける問題に対処するため、本稿では自動応答生成によって人間の事実確認者を支援する方法を検討する。
  • 大規模なオリジナルツイートと事実確認返信のペairデータセットを収集・分析し、事実確認コミュニケーションにおける言語的パターンを理解する。
  • オリジナルツイートに対して関連性が高く、形式的で、事実確認意図を持つ応答を生成するテキスト生成フレームワークを開発する。これにより、事実確認者の影響力を拡大する。
  • 自動評価指標と人的評価を用いて、モデルの性能をベースラインと比較し、関連性と形式的特徴の向上を確認する。

提案手法

  • 著者らは、Twitter上での信頼できる事実確認ソースを引用するユーザーによる、64,110件のオリジナルツイートと事実確認返信のペアからなるデータセットを収集した。
  • 事実確認ツイートの言語的特徴を分析した結果、事実確認者は形式的な言語を用い、スラングや下品語を避け、主に証拠をもとに誤情報に反論していることが明らかになった。
  • 二重教師知識蒸留を組み合わせたシーケンス・ツー・シーケンステキスト生成モデル(FCRG-DT)を提案。二つの教師モデルからの知識を統合することで、応答品質を向上させる。
  • モデルは、学習から生成された単語埋め込みを用い、入力ツイートと生成応答の間でアテンション機構を活用して照合する。
  • 自動評価指標(ROUGE、BLEU、F1)と人的アノテーションを用いてフレームワークを評価し、ベースラインモデル(SeqAttB、FCRG-Baseline)と比較した。

実験結果

リサーチクエスチョン

  • RQ1誤情報への対応において、事実確認者は通常のユーザーとどのように言語的に異なるか?
  • RQ2誤情報の反論を目的としたツイートが、ランダムまたは非事実確認返信と区別される主な言語的・構造的特徴は何か?
  • RQ3オリジナルツイートに基づいて、高い関連性と形式的トーンを持つ事実確認応答を効果的に生成できる深層学習モデルを訓練できるか?
  • RQ4提案されたFCRG-DTモデルは、明確な事実確認意図を持つ応答を生成する点で、ベースラインモデルと比べてどのように異なるか?

主な発見

  • 事実確認ツイートは、通常の返信やランダムな返信よりも顕著に形式的であり、呪いの言葉やインターネットスラングが少ない。これは説得的なコミュニケーション戦略を示している。
  • 事実確認者は、主に誤情報を否定する方向で反論しており、オリジナルツイートの主張に対して非常に的を射ている。
  • FCRG-DTモデルは、自動評価指標と人的評価の両方で、ベースラインモデル比で関連性において最大30%の向上を達成した。
  • 人的評価により、FCRG-DTの応答は、競合モデルの応答よりも関連性が高く、形式的に整えられていることが確認された。
  • モデルが学習した単語埋め込みは、意味的関係を的確に捉えており、例として「obamacare」が「healthcare」と「immunity」と意味的に近い位置に配置され、「politifact」が「debunks」と「answered」と関連していることが観察された。
  • 事実確認記事の内容を活用しても性能向上が得られなかったため、外部の記事テキストに依存するのではなく、直接的ツイートから応答を生成するアプローチが、より効果的であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。