Skip to main content
QUICK REVIEW

[论文解读] Adversarial NLI for Factual Correctness in Text Summarisation Models

Mario Barrantes, Benedikt Herudek|arXiv (Cornell University)|May 24, 2020
Topic Modeling参考文献 31被引用 8
一句话总结

本文提出在对抗性自然语言推理(Adversarial NLI, ANLI)数据集上微调基于Transformer的自然语言推理(NLI)模型,以提升抽取式文本摘要中的事实正确性。通过利用蕴含概率排序——即根据摘要与源文档之间的逻辑一致性来选择摘要——在ANLI上微调的模型相比先前的NLI模型显著提升了准确率,证明其在检测事实正确摘要方面具备更强的鲁棒性和可靠性。

ABSTRACT

We apply the Adversarial NLI dataset to train the NLI model and show that the model has the potential to enhance factual correctness in abstract summarization. We follow the work of Falke et al. (2019), which rank multiple generated summaries based on the entailment probabilities between an source document and summaries and select the summary that has the highest entailment probability. The authors' earlier study concluded that current NLI models are not sufficiently accurate for the ranking task. We show that the Transformer models fine-tuned on the new dataset achieve significantly higher accuracy and have the potential of selecting a coherent summary.

研究动机与目标

  • 解决当前抽取式摘要模型存在的关键缺陷:尽管ROUGE分数较高,但仍会生成事实错误或自相矛盾的摘要。
  • 克服现有NLI模型(如SNLI、MNLI)依赖虚假统计模式、难以泛化到摘要任务的局限性。
  • 通过在更具鲁棒性的对抗性构建的ANLI数据集上训练NLI模型,提升基于蕴含的摘要排序的可靠性。
  • 验证在ANLI上微调的模型在从多个生成候选摘要中选择事实正确摘要方面优于基线NLI模型。
  • 通过注意力可视化提供对模型行为的可解释性洞察,理解ANLI微调如何促进推理能力的提升。

提出的方法

  • 在对抗性自然语言推理(ANLI)数据集上微调预训练的Transformer模型(BERT、RoBERTa、XLNet),以增强其推理能力。
  • 应用NLI模型计算源文档与多个生成摘要之间的蕴含概率,采用Falke等人(2019)提出的排序策略。
  • 选择蕴含概率最高的摘要作为最终输出,利用NLI实现事实一致性的过滤。
  • 使用注意力可视化工具(如Vig,2019)解释模型行为,分析ANLI微调后注意力模式的变化。
  • 在Falke等人(2019)的验证集上比较性能,量化基线模型在蕴含准确率上的改进。
  • 对注意力头进行消融实验和定性分析,评估ANLI训练是否减少了虚假注意力模式(例如,'sex'与'service'等无关词之间的注意力)

实验结果

研究问题

  • RQ1在ANLI数据集上微调NLI模型是否能显著提升其检测抽取式摘要中事实正确性的能力?
  • RQ2ANLI中的对抗性训练过程是否相比标准NLI数据集,能带来更鲁棒且更具泛化能力的蕴含预测?
  • RQ3ANLI微调后的NLI模型中的注意力模式与仅在MNLI上微调的模型相比有何不同,特别是在虚假词元关联方面?
  • RQ4ANLI微调后的NLI模型在从多个候选摘要中选择正确摘要方面,相比基线模型有多大的性能优势?
  • RQ5可解释性工具能否揭示ANLI微调模型做出更准确蕴含判断的机制性原因?

主要发现

  • 在ANLI上微调的NLI模型在选择事实正确摘要方面显著优于仅在MNLI或SNLI上微调的模型。
  • 该性能提升在Falke等人(2019)的验证集上得到定量验证,表明蕴含准确率有明显提高。
  • 注意力可视化显示,ANLI微调减少了无关词元之间的虚假注意力——例如,'sex'与'service'之间的注意力显著减弱,纠正了仅在MNLI上微调的模型中先前存在的错误。
  • ANLI微调模型的早期层更强烈地编码了前提-假设关系,表明改进的推理能力在网络早期即被捕捉。
  • 在ANLI上训练的模型展现出更连贯的注意力模式,'service'更倾向于关注语义相关的词如'counselling'和'relate',而非无关词。
  • 结果证实,ANLI训练可缓解捷径学习问题,提升泛化能力,尤其在涉及细微语义差异的复杂现实摘要场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。