[論文レビュー] Complex Claim Verification with Evidence Retrieved in the Wild
本稿では、主張が発表される前におけるウェブから取得した生の証拠を用いて、複雑な政治的主張を完全に自動化されたパイプラインで検証する初の手法を提示する。主張の分解、段階的なリtrieval、およびLLMベースの要約を活用する。ベースラインと比較して、真実性分類の性能が向上し、人間がアノテートした要約が忠実かつ関連性があることが示されたが、現実世界の状況では証拠カバレッジが不完全であることが課題である。
Evidence retrieval is a core part of automatic fact-checking. Prior work makes simplifying assumptions in retrieval that depart from real-world use cases: either no access to evidence, access to evidence curated by a human fact-checker, or access to evidence available long after the claim has been made. In this work, we present the first fully automated pipeline to check real-world claims by retrieving raw evidence from the web. We restrict our retriever to only search documents available prior to the claim's making, modeling the realistic scenario where an emerging claim needs to be checked. Our pipeline includes five components: claim decomposition, raw document retrieval, fine-grained evidence retrieval, claim-focused summarization, and veracity judgment. We conduct experiments on complex political claims in the ClaimDecomp dataset and show that the aggregated evidence produced by our pipeline improves veracity judgments. Human evaluation finds the evidence summary produced by our system is reliable (it does not hallucinate information) and relevant to answering key questions about a claim, suggesting that it can assist fact-checkers even when it cannot surface a complete evidence set.
研究の動機と目的
- 主張が提示される前、すなわち事後的またはキュレート済みの事実確認資料に依存せず、ウェブから現実世界の証拠を取得することで、自動的事実確認におけるギャップを埋めること。
- 主張の発表日以前に公開された文書に限定して証拠収集を行うことで、現実の事実確認ワークフローを模倣する完全自動化パイプラインを開発すること。
- 収集した証拠に基づいて生成された主張中心の要約の信頼性と関連性を評価すること、特に完全な証拠が入手できない状況下での評価を目的とする。
- 複雑で多面的な政治的主張に対して、証拠収集の質を向上させるために主張の分解がどの程度有効であるかを調査すること。
- 主張の自動収集に失敗する主な要因を同定し、初期の自動結果が不十分な場合に反復的に改善できる人間を含むループシステムの有効性を検討すること。
提案手法
- 主張の分解により、複雑な政治的主張をYes/Noの部分的質問に分解し、収集精度の向上と暗黙の側面のカバーを図る。
- 商用検索エンジン(Bing)を用いて、各部分的質問に関連する文書を収集するが、主張の公開日以前に公開されたものに限定する。
- 第二段階として、細かく特化したリtrievalモデルを適用し、収集された文書から最も関連性の高い段落を抽出する。
- 収集した証拠に基づいて、最先端のLLMを用いて主張中心の要約を生成し、真実性判断を支援する。
- 生成された要約を用いて真実性分類器を学習し、専門的な事実確認者によるラベルと比較して結果を評価する。
- 人間による評価を実施し、要約の忠実性と包括性を、幻覚や主張の側面への関連性といった基準を用いて評価する。
実験結果
リサーチクエスチョン
- RQ1主張発表前のウェブ証拠を完全に自動化されたパイプラインが収集可能であり、事実確認サイトやキュレート済みコーパスに依存せずに、複雑な政治的主張を検証できるか。
- RQ2複雑な主張に対して、主張の分解が、オープンウェブからの証拠収集の質をどの程度向上させるか。
- RQ3LLMが生成する主張中心の要約は、収集した証拠をどの程度忠実に表現し、正確な真実性判断を支援できるか。
- RQ4主張発表前のウェブ文書のみに依存する場合、証拠収集の主な失敗モードは何か。
- RQ5初期の自動結果が不十分な場合に、人間を含むループシステムが反復的に証拠収集と要約の質を改善できるか。
主な発見
- 証拠なしのベースラインと比較して、パイプラインは真実性分類の性能が向上しており、ウェブ証拠収集の価値を示している。
- 第一段階の収集は、36.0%の部分的質問で失敗しており、主に発表前の関連証拠がウェブ上に存在しないことが示唆されている。
- 元の主張そのものに依存する場合と比較して、主張の分解により収集の質が顕著に向上しており、真実性分類の性能向上が確認された。
- 人間による評価により、生成された要約はほとんど忠実かつ関連性があることが確認され、14件の完全に処理可能な主張のうち、重大な事実の誤りは1件のみであった。
- 収集された証拠はしばしば主張の一部の側面しかカバーしていないことが明らかであり、現実の事実確認における不完全な証拠という根本的な課題が浮き彫りになった。
- 本研究では、収集失敗の主な原因として、発表前の情報の不在と、部分的質問の質の低さを同定し、質問生成と文脈の除去の分野における改善の余地があると示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。