Skip to main content
QUICK REVIEW

[论文解读] Can NLI Models Verify QA Systems' Predictions?

Jifan Chen, Eunsol Choi|arXiv (Cornell University)|Apr 18, 2021
Topic Modeling参考文献 59被引用 4
一句话总结

本文提出了一种新颖的框架,通过将问题回答(QA)样本转换为前提-假设对,利用自然语言蕴涵(NLI)模型验证QA系统预测的正确性。该方法通过问题转换和去上下文化实现,提升了QA模型的置信度校准能力,并能识别出因错误原因而得出正确答案的情况,在选择性预测设置下F1分数最高提升5.5分。

ABSTRACT

To build robust question answering systems, we need the ability to verify whether answers to questions are truly correct, not just "good enough" in the context of imperfect QA datasets. We explore the use of natural language inference (NLI) as a way to achieve this goal, as NLI inherently requires the premise (document context) to contain all necessary information to support the hypothesis (proposed answer to the question). We leverage large pre-trained models and recent prior datasets to construct powerful question converter and decontextualization modules, which can reformulate QA instances as premise-hypothesis pairs with very high reliability. Then, by combining standard NLI datasets with NLI examples automatically derived from QA training data, we can train NLI models to judge the correctness of QA models' proposed answers. We show that our NLI approach can generally improve the confidence estimation of a QA model across different domains, evaluated in a selective QA setting. Careful manual analysis over the predictions of our NLI model shows that it can further identify cases where the QA model produces the right answer for the wrong reason, or where the answer cannot be verified as addressing all aspects of the question.

研究动机与目标

  • 解决QA系统在分布偏移或虚假模式下常产生看似合理但错误答案的鲁棒性不足问题。
  • 通过将NLI作为验证机制,区分正确与错误推理,提升QA模型的置信度校准能力。
  • 探究基于NLI的验证是否能检测QA模型在使用不足或无关上下文时得出正确答案的情况。
  • 评估在混合数据集(包括自动生成的QA衍生NLI样本)上预训练的NLI模型在跨域QA泛化中的兼容性。
  • 通过NLI的蕴涵标准隔离问题与支持性上下文之间的信息不匹配,实现显式的错误分析。

提出的方法

  • 通过两阶段流水线(问题转换与去上下文化)将(问题,上下文,答案)三元组转换为(前提,假设)NLI对。
  • 采用微调后的强大预训练T5模型进行问题到陈述句的转换,以提升假设表述质量。
  • 应用去上下文化模型重写来自上下文的答案句子,使其在无文档支持下仍能独立成立,同时保持语义完整性。
  • 通过结合标准NLI数据集(如SNLI、MNLI)与自动生成的QA衍生NLI对,构建大规模NLI数据集。
  • 在组合数据集上训练NLI模型,以预测前提与假设之间的蕴涵、矛盾或中性关系。
  • 将训练好的NLI模型用作验证器,对基础QA模型的预测进行重新排序或校准,尤其在低置信度或跨域设置下。

实验结果

研究问题

  • RQ1NLI模型能否通过评估答案是否由支持性上下文逻辑蕴涵,有效验证QA系统预测?
  • RQ2在跨域QA数据集中,引入QA衍生的NLI样本在多大程度上提升了基于NLI的验证在泛化能力和校准性方面的表现?
  • RQ3NLI模型的蕴涵判断在多大程度上与问题的实际信息需求一致,尤其是在上下文不完整时?
  • RQ4NLI验证流水线的失败模式是什么?它们与原始QA模型的错误有何不同?
  • RQ5NLI验证框架能否检测出QA模型因错误或不完整推理而得出正确答案的情况?

主要发现

  • 在Top 20%最自信预测的筛选性预测设置下,基于NLI的验证框架将基础QA模型的F1分数从81.6提升至87.1。
  • 去上下文化和问题转换模块对流水线性能至关重要,这些阶段的错误仅占NLI模型总错误的一小部分。
  • 约10%至15%的验证失败源于上下文不足,表明当关键信息缺失时,模型常会误判答案。
  • 人工分析显示,NLI模型能成功识别出QA模型因错误原因而得出正确答案的情况,尤其在前提缺乏充分信息支持假设时。
  • 结合标准NLI数据集与自动生成的QA衍生NLI样本,可构建出更具鲁棒性的验证器,其在跨域泛化能力上优于仅依赖领域内QA数据的模型。
  • 该方法实现了显式的错误定位,使系统设计者能够区分基于有效推理的正确答案与基于部分或错误证据的正确答案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。