[论文解读] Zero-shot Fact Verification by Claim Generation
该论文提出QACG,一种零样本事实验证框架,通过将来自维基百科证据的问答对转换为标记为支持、反驳或NEI(信息不足)的陈述,生成合成训练数据。通过在30万条自动生成的(证据,陈述)对上预训练RoBERTa模型,该方法在FEVER上实现了77%的F1分数,且无需任何人工标注数据,性能与在2,000个人工标注样本上微调的模型相当。
Neural models for automated fact verification have achieved promising results thanks to the availability of large, human-annotated datasets. However, for each new domain that requires fact verification, creating a dataset by manually writing claims and linking them to their supporting evidence is expensive. We develop QACG, a framework for training a robust fact verification model by using automatically generated claims that can be supported, refuted, or unverifiable from evidence from Wikipedia. QACG generates question-answer pairs from the evidence and then converts them into different types of claims. Experiments on the FEVER dataset show that our QACG framework significantly reduces the demand for human-annotated training data. In a zero-shot scenario, QACG improves a RoBERTa model's F1 from 50% to 77%, equivalent in performance to 2K+ manually-curated examples. Our QACG code is publicly available.
研究动机与目标
- 解决在新领域中事实验证任务中人工标注训练数据的高昂成本问题。
- 探索使用自动生成的陈述而非人工标注示例进行零样本事实验证。
- 通过利用问题生成和QA到陈述的转换,减少对领域内人工标注的依赖。
- 提升低资源环境下事实验证模型的鲁棒性和性能。
- 评估合成陈述是否能匹配或接近基于人工标注数据训练的模型性能。
提出的方法
- 该框架使用在SQuAD上微调过的预训练BART模型,从证据和答案片段生成问题。
- 利用在QA2D数据集上微调的第二个BART模型,将每个(问题,答案)对转换为陈述性陈述。
- 若答案在证据中正确且可验证,则将陈述标记为支持;若答案错误,则标记为反驳;若问题无法从证据中回答,则标记为NEI。
- 从维基百科段落中每类标签(支持、反驳、NEI)生成10万条陈述,用于预训练基于RoBERTa的事实验证模型。
- 使用生成的数据在零样本设置下预训练事实验证模型,随后在少样本场景中使用极少的人工数据进行微调。
- 该框架通过逻辑假设确保标签一致性:正确答案 → 支持性陈述;错误答案 → 反驳性陈述;无法回答的问题 → NEI陈述。
实验结果
研究问题
- RQ1在缺乏人工标注数据的情况下,从维基百科段落中自动生成的陈述能否有效预训练事实验证模型?
- RQ2在零样本和少样本设置下,基于合成陈述训练的事实验证模型性能与基于人工标注数据训练的模型相比如何?
- RQ3生成的陈述在多大程度上反映了人工标注陈述的推理复杂性和语言多样性?
- RQ4使用合成陈述进行预训练是否能提升事实验证模型在无偏测试集上的鲁棒性?
- RQ5当前陈述生成在处理多跳推理、常识推理或数值推理方面存在哪些局限?
主要发现
- QACG框架在FEVER基准的零样本设置下实现了77%的F1分数,与在2,000个人工标注示例上微调的RoBERTa模型性能相当。
- 仅使用每类100个人工标注示例时,模型性能达到在超过10万个示例上训练的全监督模型的89.1%。
- 在所有少样本设置中,基于生成数据训练的模型均优于从零开始训练的模型,当每类仅使用50个标注样本时,F1分数提升了25.7分。
- 人工评估确认,生成的陈述语言流畅、标签一致且语言多样,但缺乏深层推理能力。
- FEVER中相当一部分人工标注的陈述(38%支持,16%反驳)需要常识或世界知识,表明生成陈述与人工标注陈述之间存在领域差距。
- 该框架表明,合成数据生成可作为低资源领域事实验证的有效‘预热启动’策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。