Skip to main content
QUICK REVIEW

[論文レビュー] Zero-shot Fact Verification by Claim Generation

Liangming Pan, Wenhu Chen|arXiv (Cornell University)|May 31, 2021
Topic Modeling参考文献 20被引用数 8
ひとこと要約

本論文では、Wikipediaの証拠から得られる質問・回答ペアを、支援済み、反証済み、NEI(情報不足)のラベルが付与された主張に変換することで、合成学習データを生成するゼロショット事実検証フレームワークQACGを提案する。30万個の自動生成された(証拠、主張)ペアで事前学習されたRoBERTaモデルは、人為的ラベルなしでFEVERで77%のF1スコアを達成し、2,000件の人的ラベル付き例で微調整されたモデルと同等の性能を発揮する。

ABSTRACT

Neural models for automated fact verification have achieved promising results thanks to the availability of large, human-annotated datasets. However, for each new domain that requires fact verification, creating a dataset by manually writing claims and linking them to their supporting evidence is expensive. We develop QACG, a framework for training a robust fact verification model by using automatically generated claims that can be supported, refuted, or unverifiable from evidence from Wikipedia. QACG generates question-answer pairs from the evidence and then converts them into different types of claims. Experiments on the FEVER dataset show that our QACG framework significantly reduces the demand for human-annotated training data. In a zero-shot scenario, QACG improves a RoBERTa model's F1 from 50% to 77%, equivalent in performance to 2K+ manually-curated examples. Our QACG code is publicly available.

研究の動機と目的

  • 新しいドメインにおける事実検証のための人的ラベル付き学習データの高コストを解消すること。
  • 人的ラベル付き例の代わりに自動生成された主張を用いたゼロショット事実検証を検討すること。
  • 質問生成とQAから主張への変換を活用することで、ドメイン内的人的ラベル依存度を低減すること。
  • リソースが限られた環境における事実検証モデルの頑健性と性能を向上させること。
  • 合成された主張が人的ラベル付きデータで学習されたモデルと同等またはそれに近い性能を発揮するかどうかを評価すること。

提案手法

  • SQuADで微調整された事前学習済みBARTモデルを用いて、証拠と回答のスパンから質問を生成する。
  • QA2Dデータセットで微調整された第二のBARTモデルを用いて、各(質問、回答)ペアを宣言的主張に変換する。
  • 回答が正しくかつ証拠内で検証可能な場合に「支援済み」、回答が誤りの場合は「反証済み」、証拠から質問に答えられない場合は「NEI」にラベルを付与する。
  • Wikipediaの本文から、支援済み・反証済み・NEIの各ラベルタイプごとに10万件の主張を生成し、RoBERTaベースの事実検証モデルを事前学習する。
  • 生成されたデータを用いてゼロショット設定で事前学習した後、少数の人的データでファインチューニングを行う。
  • 論理的仮定を活用することでラベルの一貫性を保証する:正しい回答 → 支援済み主張、誤った回答 → 反証済み主張、回答不能な質問 → NEI主張

実験結果

リサーチクエスチョン

  • RQ1Wikipediaの本文から自動生成された主張は、人的ラベル付きデータが存在しない状況で、事実検証モデルの事前学習に効果的に利用できるか?
  • RQ2合成主張で学習した事実検証モデルの性能は、ゼロショットおよびファームショット設定において人的ラベル付きデータで学習したモデルと比べてどの程度か?
  • RQ3生成された主張は、人的ラベル付き主張の推論の複雑さと言語的多様性をどの程度反映しているか?
  • RQ4合成主張で事前学習することで、偏りのないテストセットにおける事実検証モデルの頑健性は向上するか?
  • RQ5現在の主張生成技術には、マルチホップ推論、常識的推論、数値的推論を処理する際の限界がどの程度あるか?

主な発見

  • QACGフレームワークは、ゼロショット設定でFEVERベンチマークで77%のF1スコアを達成し、2,000件の人的ラベル付き例で微調整されたRoBERTaモデルと同等の性能を発揮した。
  • 各クラスに100件の人的ラベル付き例しか使用しない状況でも、10万件以上の例で学習された完全な教師ありモデルの89.1%の性能に達した。
  • 生成された主張で学習したモデルは、すべてのファームショット状況で、初期学習から開始したモデルを上回り、各クラスに50件のラベル付き例を使用した場合に25.7ポイントのF1スコア向上を達成した。
  • 人的評価では、生成された主張が流暢で、ラベルの一貫性があり、言語的に多様であることが確認されたが、深層的推論能力には欠けることが分かった。
  • FEVERに含まれる人的ラベル付き主張の38%(支援済み)、16%(反証済み)は、常識的知識や世界知識を必要としており、生成主張と人的主張との間にはドメインギャップが存在することが示唆された。
  • 本フレームワークは、リソースが限られたドメインにおける事実検証のための効果的な「ウォームスタート」としての合成データ生成の有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。