[論文レビュー] AVeriTeC: A Dataset for Real-world Claim Verification with Evidence from the Web
AVeriTeCは、50の fact-checking 組織から得た4,568件の現実世界の主張を含む新しいデータセットを提供する。各主張は、Web で取得した証拠、質問と回答のペア、および判断の根拠を付加してアノテートされている。このデータセットは、文脈依存性、証拠不足、時系列漏洩といった既存の fact-checking ベンチマークの主な限界を、複数ラウンドのアノテーションプロセスにより解決し、高いアノテータ間一貫性(κ = 0.619)を達成した。また、検索とコンテキスト内学習を用いたリtrieval増強型主張検証のためのベースラインを提供する。
Existing datasets for automated fact-checking have substantial limitations, such as relying on artificial claims, lacking annotations for evidence and intermediate reasoning, or including evidence published after the claim. In this paper we introduce AVeriTeC, a new dataset of 4,568 real-world claims covering fact-checks by 50 different organizations. Each claim is annotated with question-answer pairs supported by evidence available online, as well as textual justifications explaining how the evidence combines to produce a verdict. Through a multi-round annotation process, we avoid common pitfalls including context dependence, evidence insufficiency, and temporal leakage, and reach a substantial inter-annotator agreement of $κ=0.619$ on verdicts. We develop a baseline as well as an evaluation scheme for verifying claims through several question-answering steps against the open web.
研究の動機と目的
- 既存の自動 fact-checking データセットに見られる、人工的主張、証拠アノテーション不足、時系列データ漏洩といった重要な限界を是正すること。
- オープンウェブからの証拠を用いて、現実世界の主張検証のための現実的でスケーラブルなベンチマークを構築すること。
- 主張の正規化と証拠の十分性チェックにより、文脈依存性を低減することで、高品質なアノテーションを確保すること。
- 主張日より前に公開された文書に限定して証拠を用いることで、時系列漏洩を防ぐため、訓練/開発/テスト分割の時系列順序を厳密に守ること。
- 質問と回答の分解と人間による根拠提示を通じて、構造的かつ解釈可能な検証フレームワークを提供すること。
提案手法
- 主張は、Google FactCheck Claim Search API を介して50の fact-checking 組織から収集され、現実世界の関連性を保証する。
- 複数ラウンドのアノテーションパイプラインには、主張の正規化、質問と回答ペアの生成、証拠の十分性チェックが含まれ、文脈依存性と証拠不足を低減する。
- 「ブラインド」品質管理ステップでは、証拠が不十分な主張を再アノテートすることで、耐性と一貫性を確保する。
- 時系列制約により、主張日より前に公開された文書のみを証拠として使用し、分割間での時系列漏洩を排除する。
- Google Search、BM25 検索、コンテキスト内プロンプト、ステイント検出モデルを用いて、リtrieval増強型ベースラインを構築する。
- アノテーターが推論を説明するための根拠を生成し、比較、丸め処理、矛盾検出などを含む。これにより、解釈可能性が保証される。
実験結果
リサーチクエスチョン
- RQ1現実世界の主張と Web で取得した証拠を用いた fact-checking データセットを構築する際、文脈依存性を回避できるか?
- RQ2繰り返しアノテーションと品質管理を用いることで、自動 fact-checking データセットにおける証拠不足をどの程度低減できるか?
- RQ3時系列順序と証拠ソースの制約を用いることで、ベンチマークデータセットにおける時系列漏洩をどの程度防止できるか?
- RQ4質問と回答の分解は、自動主張検証における解釈可能性とパフォーマンスを向上させられるか?
- RQ5オープンウェブからの証拠とコンテキスト内学習を用いたリtrieval増強型ベースラインは、現実世界の主張に対してどの程度のパフォーマンスを示すか?
主な発見
- AVeriTeC には、Google FactCheck Claim Search API を介して収集された50の fact-checking 組織から得た4,568件の現実世界の主張が含まれる。
- 各判断に対して質問と回答ペア、および詳細な根拠が付加されており、解釈可能な検証を可能にする。
- 判断に関するアノテータ間一貫性は、自由マージン加重カッパ(κ = 0.619)で高く、強い一貫性を示している。
- fact-checking 論文からの情報を用いて主張を正規化することで、アノテーションプロセスが文脈依存性を効果的に低減した。
- 複数ラウンドのアノテーションと、不十分な証拠を持つ主張を再アノテートするブラインド品質管理ステップにより、証拠不足が低減された。
- 主張日より前に公開された文書に限定して証拠を用いることと、訓練/開発/テスト分割の時系列順序を厳密に守ることで、時系列漏洩が防止された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。