Skip to main content
QUICK REVIEW

[論文レビュー] Evidence-based Verification for Real World Information Needs.

James Thorne, Max Glockner|arXiv (Cornell University)|Apr 1, 2021
Topic Modeling参考文献 35被引用数 12
ひとこと要約

本稿では、実際の検索クエリから抽出された10,987件の主張から構成される大規模で現実世界の主張検証データセットを紹介する。このデータセットは、セクションおよび文レベルの詳細なWikipedia証拠をアノテートしている。証拠抽出 followed by 順接認識がステークス分類と同等の正確性を達成することを示しており、根拠の生成を伴う正確で解釈可能な検証が可能であることを示している。

ABSTRACT

Claim verification is the task of predicting the veracity of written statements against evidence. Previous large-scale datasets model the task as classification, ignoring the need to retrieve evidence, or are constructed for research purposes, and may not be representative of real-world needs. In this paper, we introduce a novel claim verification dataset with instances derived from search-engine queries, yielding 10,987 claims annotated with evidence that represent real-world information needs. For each claim, we annotate evidence from full Wikipedia articles with both section and sentence-level granularity. Our annotation allows comparison between two complementary approaches to verification: stance classification, and evidence extraction followed by entailment recognition. In our comprehensive evaluation, we find no significant difference in accuracy between these two approaches. This enables systems to use evidence extraction to summarize a rationale for an end-user while maintaining the accuracy when predicting a claim's veracity. With challenging claims and evidence documents containing hundreds of sentences, our dataset presents interesting challenges that are not captured in previous work -- evidenced through transfer learning experiments. We release code and data to support further research on this task.

研究の動機と目的

  • 実際の検索クエリから得られる真のユーザーの情報ニーズに基づいた、既存のデータセットに欠けている主張検証ベンチマークを提供すること。
  • 完全なWikipedia記事からの高品質で詳細な証拠アノテーション(セクションおよび文レベルの参照を含む)を備えたデータセットを構築すること。
  • ステークス分類と証拠抽出 followed by 順接認識の2つの補完的検証アプローチの評価を可能にすること。
  • 複雑で長文の証拠文書を反映する、トランスファー学習と現実世界への適用性を考慮した挑戦的なベンチマークを提供すること。
  • 再現可能性とさらなる開発を支援するため、コードとデータを公開して今後の研究を支援すること。

提案手法

  • 検索エンジンのクエリログから主張を収集し、真のユーザーの情報ニーズと整合することを保証する。
  • 各主張に対して、完全なWikipedia記事からの証拠をアノテートし、正確性を高めるためにセクションおよび文レベルの参照を明示する。
  • ステークス分類と証拠抽出 + 順接認識パイプラインを比較する二重評価フレームワークを設計する。
  • 人間によるアノテート済み証拠を用いて、両方の検証パラダイムにおけるモデルの学習と評価を行い、一貫性と信頼性を確保する。
  • このデータセット上でトランスファー学習の実験を実施し、モデルの一般化性能と、先行ベンチマークと比較した課題の難易度を評価する。
  • データセットとコードを公開し、コミュニティ研究と再現性を支援する。

実験結果

リサーチクエスチョン

  • RQ1証拠抽出 followed by 順接認識は、現実世界の主張検証においてステークス分類と同等の正確性を達成するか?
  • RQ2実際のユーザーの検索クエリから抽出された主張では、合成的または選別されたデータセットと比較して、モデルの性能はどのように異なるか?
  • RQ3長く複雑な証拠文書(数百文にわたる)は、既存の検証モデルにどの程度の挑戦をもたらすか?
  • RQ4証拠抽出を用いたシステムは、真偽予測の正確性を損なわせることなく、解釈可能な根拠を提供できるか?
  • RQ5このデータセットの現実世界的性質は、異なるモデルアーキテクチャ間でのトランスファー学習性能にどのように影響するか?

主な発見

  • 提案されたデータセットにおいて、ステークス分類と証拠抽出 followed by 順接認識の間には、正確性に顕著な差がないことが確認された。
  • 数百文にわたる長く複雑な証拠文書を含むため、このデータセットは、先行するベンチマークを上回る意味のある課題を提供している。
  • トランスファー学習の実験から、このデータセットで学習したモデルは、以前のデータセットでは捉えきれない独自の課題に直面することが確認され、より現実世界に近い忠実性を示している。
  • 詳細な証拠アノテーションにより、システムは高精度な予測を維持しながら、解釈可能な根拠を生成することが可能になった。
  • データセットとコードの公開により、今後の研究において解釈可能で証拠に基づく主張検証の分野が支援される。
  • 本研究の結果は、証拠抽出が現実世界の応用においてエンドツーエンドのステークス分類の代替手段として実用的で透明性のある選択肢であることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。