[论文解读] Factual Error Correction for Abstractive Summarization Models
本文提出了一种后编辑校正模块,通过利用基于启发式损坏的参考摘要微调的神经模型,识别并纠正生成式摘要输出中的事实性错误。该模型在不一致的真实摘要上实现了17.74%的纠正率,在一致摘要上实现了1.13%的假阳性率,优于先前的方法在事实一致性评估中的表现。
Neural abstractive summarization systems have achieved promising progress, thanks to the availability of large-scale datasets and models pre-trained with self-supervised methods. However, ensuring the factual consistency of the generated summaries for abstractive summarization systems is a challenge. We propose a post-editing corrector module to address this issue by identifying and correcting factual errors in generated summaries. The neural corrector model is pre-trained on artificial examples that are created by applying a series of heuristic transformations on reference summaries. These transformations are inspired by an error analysis of state-of-the-art summarization model outputs. Experimental results show that our model is able to correct factual errors in summaries generated by other neural summarization models and outperforms previous models on factual consistency evaluation on the CNN/DailyMail dataset. We also find that transferring from artificial error correction to downstream settings is still very challenging.
研究动机与目标
- 为解决生成式摘要模型中常见的幻觉或错误事实导致的事实不一致问题。
- 开发一种后编辑校正模块,在不重新训练主摘要模型的前提下提升事实一致性。
- 在通过启发式变换参考摘要生成的人工事实错误上进行校正模型的训练。
- 将校正器评估为摘要输出的事实一致性评估工具和校正工具。
- 探究人工错误校正与真实摘要模型错误之间的泛化差距。
提出的方法
- 校正器是一个序列到序列模型,其在合成数据上进行训练,其中参考摘要通过受先进摘要模型错误分析启发的启发式转换进行损坏。
- 损坏技术包括实体替换、时间位移和事实删除,以模拟生成式输出中的常见事实错误。
- 模型通过端到端微调,基于源文档和原始草稿摘要生成校正后的摘要。
- 校正器既作为校正模型(在包含不一致摘要的测试集上)也作为一致性评估器(通过检测是否需要修改)进行评估。
- 该模型利用预训练的Transformer架构,并在损坏样本上使用掩码语言建模范式进行训练。
- 在CNN/DailyMail和K2019数据集上测试了其在真实摘要模型输出上的可迁移性,并通过人工评估验证其可靠性与正确性。
实验结果
研究问题
- RQ1神经后编辑校正器能否有效识别并纠正生成式模型生成摘要中的事实错误?
- RQ2在人工错误上训练的校正器在真实摘要模型的事实不一致问题上泛化能力如何?
- RQ3校正器在多大程度上可作为生成式摘要的可靠事实一致性评估工具?
- RQ4校正准确率与对事实正确摘要的无意修改之间存在何种权衡?
- RQ5为何人工错误校正与真实世界错误校正设置之间的性能差距如此之大?
主要发现
- 在校正人工测试集上,校正器成功将62.13%的启发式损坏摘要纠正为与参考一致,纠正率达到62.13%。
- 在K2019真实世界测试集上,校正器成功纠正了62个不一致摘要中的11个,纠正率为17.74%。
- 在441个一致摘要中,模型错误地进行了5次修改,假阳性率为1.13%,表明其在正确摘要上具有很强的可靠性。
- 模型在真实摘要上的表现显著低于在人工数据上的表现,表明合成与真实事实错误之间存在分布差异。
- 在校正K2019数据集的事实一致性评估中,校正器优于BERT和FactCC,证明其作为评估工具的有效性。
- 人工评估确认,校正器能够可靠地纠正事实不一致,同时最大限度减少对已正确摘要的有害修改。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。