Skip to main content
QUICK REVIEW

[論文レビュー] Generating Fact Checking Briefs

Angela Fan, Aleksandra Piktus|arXiv (Cornell University)|Jan 1, 2020
Topic Modeling参考文献 43被引用数 4
ひとこと要約

本稿では、特に質疑応答型要約(QABriefs)を導入することで、人間による事実確認の正確性と効率性を向上させる手法を提案する。新規モデルであるQABRIEFERと、クラウドソーシングで得たデータセット(QABRIEFDATASET)を用いて、QABriefsは検索バーのみを用いる場合と比較して、作業者の正確性を10%向上させるとともに、確認作業時間を20%短縮することを示している。

ABSTRACT

Fact checking at scale is difficult -- while the number of active fact checking websites is growing, it remains too small for the needs of the contemporary media ecosystem. However, despite good intentions, contributions from volunteers are often error-prone, and thus in practice restricted to claim detection. We investigate how to increase the accuracy and efficiency of fact checking by providing information about the claim before performing the check, in the form of natural language briefs. We investigate passage-based briefs, containing a relevant passage from Wikipedia, entity-centric ones consisting of Wikipedia pages of mentioned entities, and Question-Answering Briefs, with questions decomposing the claim, and their answers. To produce QABriefs, we develop QABriefer, a model that generates a set of questions conditioned on the claim, searches the web for evidence, and generates answers. To train its components, we introduce QABriefDataset which we collected via crowdsourcing. We show that fact checking with briefs -- in particular QABriefs -- increases the accuracy of crowdworkers by 10% while slightly decreasing the time taken. For volunteer (unpaid) fact checkers, QABriefs slightly increase accuracy and reduce the time required by around 20%.

研究の動機と目的

  • 広範な誤情報の存在に直面する中で、クラウドソーシングによる事実確認のスケーラビリティと正確性の限界を克服すること。
  • 確認プロセスの開始前に事前に検証済みの構造化された情報を提供することで、人間による事実確認のパフォーマンスを向上させること。
  • 事実確認意思決定を支援する高品質で主張特化型の要約を自動生成する手法を開発すること。
  • 事実確認モデルの訓練と評価を可能にする大規模かつ高品質なQABriefsデータセットを構築すること。
  • 要約の使用が手動による検索への依存を減らし、同時に確認作業のスピードと正確性を向上させることを実証すること。

提案手法

  • 主張を前提にした質問を生成し、その後オープンドメインQAを用いてそれらを回答する2段階モデルであるQABRIEFERを開発する。
  • 要約に使用する関連するウィキペディアのパラグラフを抽出するために、密度型パラグラフ検索(DPR)を用いる。
  • 言及されたエンティティをウィキペディアのページにリンクすることで、エンティティ中心の要約を構築する。
  • 約10,000件のQABriefsを含み、それぞれが約3組の質問と回答を含む、大規模なクラウドソーシングによるデータセット(QABRIEFDATASET)を活用する。
  • 自然質問(NQ)とQABRIEFDATASETの両方で事前学習済みのシーケンス・トゥ・シーケンスモデル(BART)を微調整し、最適なQAパフォーマンスを達成する。
  • 検索と生成のモジュールを統合し、専門家レベルの背景準備を模倣するエンドツーエンドの要約を生成する。

実験結果

リサーチクエスチョン

  • RQ1事実確認の前段階で構造化された要約を生成することで、クラウドワーカーの正確性と効率性が向上するか?
  • RQ2パラグラフベース、エンティティ中心、QABriefsといった異なる種類の要約は、事実確認パフォーマンスの支援においてどのように比較されるか?
  • RQ3自動化されたモデル(QABRIEFER)が、人間がアノテートした要約と同等の品質のQABriefsを生成できるか、その程度はどの程度か?
  • RQ4要約の使用が一般ウェブ検索への過剰な依存を減らすか、また確認品質を維持または向上させられるか?
  • RQ5要約の提供が、事実確認者の自信や意思決定行動にどのような影響を与えるか?

主な発見

  • QABRIEFERが生成したQABriefsは、検索バーのみを使用する場合と比較して、クラウドワーカーの正確性を10%向上させた。
  • QABriefsを用いたボランティアの事実確認者は、検索のみのアクセスと比較して4%の正確性向上を達成し、確認作業を20%速く完了した。
  • 人間がアノテートしたQABriefsが最も高いパフォーマンス向上をもたらし、次にQABRIEFERが生成した要約、その他の要約タイプが続いた。
  • QABriefsの提供により、過剰な自信が生じた:約45%のクラウドワーカーは、検索アクセスが正確性を向上させることを踏まえても、検索バーを使用しなかった。
  • 自然質問(NQ)とQABRIEFDATASETの両方でBARTを微調整した結果、最良のQAパフォーマンスが得られ、大規模なQAデータに対する事前学習の価値が示された。
  • 本研究では、要約が特に専門的な事実確認記事から導出された場合に、より構造的な事実確認プロセスを支援できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。