Skip to main content
QUICK REVIEW

[論文レビュー] AVeriTeC: A Dataset for Real-world Claim Verification with Evidence from the Web

Michael Schlichtkrull, Zhijiang Guo|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用数 7
ひとこと要約

AVeriTeCは、50の fact-checking 組織から得た4,568件の現実世界の主張を含む新しいデータセットを提供する。各主張は、Web で取得した証拠、質問と回答のペア、および判断の根拠を付加してアノテートされている。このデータセットは、文脈依存性、証拠不足、時系列漏洩といった既存の fact-checking ベンチマークの主な限界を、複数ラウンドのアノテーションプロセスにより解決し、高いアノテータ間一貫性(κ = 0.619)を達成した。また、検索とコンテキスト内学習を用いたリtrieval増強型主張検証のためのベースラインを提供する。

ABSTRACT

Existing datasets for automated fact-checking have substantial limitations, such as relying on artificial claims, lacking annotations for evidence and intermediate reasoning, or including evidence published after the claim. In this paper we introduce AVeriTeC, a new dataset of 4,568 real-world claims covering fact-checks by 50 different organizations. Each claim is annotated with question-answer pairs supported by evidence available online, as well as textual justifications explaining how the evidence combines to produce a verdict. Through a multi-round annotation process, we avoid common pitfalls including context dependence, evidence insufficiency, and temporal leakage, and reach a substantial inter-annotator agreement of $κ=0.619$ on verdicts. We develop a baseline as well as an evaluation scheme for verifying claims through several question-answering steps against the open web.

研究の動機と目的

  • 既存の自動 fact-checking データセットに見られる、人工的主張、証拠アノテーション不足、時系列データ漏洩といった重要な限界を是正すること。
  • オープンウェブからの証拠を用いて、現実世界の主張検証のための現実的でスケーラブルなベンチマークを構築すること。
  • 主張の正規化と証拠の十分性チェックにより、文脈依存性を低減することで、高品質なアノテーションを確保すること。
  • 主張日より前に公開された文書に限定して証拠を用いることで、時系列漏洩を防ぐため、訓練/開発/テスト分割の時系列順序を厳密に守ること。
  • 質問と回答の分解と人間による根拠提示を通じて、構造的かつ解釈可能な検証フレームワークを提供すること。

提案手法

  • 主張は、Google FactCheck Claim Search API を介して50の fact-checking 組織から収集され、現実世界の関連性を保証する。
  • 複数ラウンドのアノテーションパイプラインには、主張の正規化、質問と回答ペアの生成、証拠の十分性チェックが含まれ、文脈依存性と証拠不足を低減する。
  • 「ブラインド」品質管理ステップでは、証拠が不十分な主張を再アノテートすることで、耐性と一貫性を確保する。
  • 時系列制約により、主張日より前に公開された文書のみを証拠として使用し、分割間での時系列漏洩を排除する。
  • Google Search、BM25 検索、コンテキスト内プロンプト、ステイント検出モデルを用いて、リtrieval増強型ベースラインを構築する。
  • アノテーターが推論を説明するための根拠を生成し、比較、丸め処理、矛盾検出などを含む。これにより、解釈可能性が保証される。

実験結果

リサーチクエスチョン

  • RQ1現実世界の主張と Web で取得した証拠を用いた fact-checking データセットを構築する際、文脈依存性を回避できるか?
  • RQ2繰り返しアノテーションと品質管理を用いることで、自動 fact-checking データセットにおける証拠不足をどの程度低減できるか?
  • RQ3時系列順序と証拠ソースの制約を用いることで、ベンチマークデータセットにおける時系列漏洩をどの程度防止できるか?
  • RQ4質問と回答の分解は、自動主張検証における解釈可能性とパフォーマンスを向上させられるか?
  • RQ5オープンウェブからの証拠とコンテキスト内学習を用いたリtrieval増強型ベースラインは、現実世界の主張に対してどの程度のパフォーマンスを示すか?

主な発見

  • AVeriTeC には、Google FactCheck Claim Search API を介して収集された50の fact-checking 組織から得た4,568件の現実世界の主張が含まれる。
  • 各判断に対して質問と回答ペア、および詳細な根拠が付加されており、解釈可能な検証を可能にする。
  • 判断に関するアノテータ間一貫性は、自由マージン加重カッパ(κ = 0.619)で高く、強い一貫性を示している。
  • fact-checking 論文からの情報を用いて主張を正規化することで、アノテーションプロセスが文脈依存性を効果的に低減した。
  • 複数ラウンドのアノテーションと、不十分な証拠を持つ主張を再アノテートするブラインド品質管理ステップにより、証拠不足が低減された。
  • 主張日より前に公開された文書に限定して証拠を用いることと、訓練/開発/テスト分割の時系列順序を厳密に守ることで、時系列漏洩が防止された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。