[论文解读] Entity-level Factual Consistency of Abstractive Text Summarization
本文提出基于实体的事实一致性度量——精确率-源(prec_s)、精确率-目标(prec_t)和召回率-目标(recall_t)——以量化生成式摘要中的幻觉现象。通过过滤训练数据以去除包含未登录词实体的摘要,并引入多任务实体分类头,作者显著减少了实体幻觉,在XSUM数据集上将prec_s从低于94%提升至98%以上,同时保持ROUGE分数基本不变。
A key challenge for abstractive summarization is ensuring factual consistency of the generated summary with respect to the original document. For example, state-of-the-art models trained on existing datasets exhibit entity hallucination, generating names of entities that are not present in the source document. We propose a set of new metrics to quantify the entity-level factual consistency of generated summaries and we show that the entity hallucination problem can be alleviated by simply filtering the training data. In addition, we propose a summary-worthy entity classification task to the training process as well as a joint entity and summary generation approach, which yield further improvements in entity level metrics.
研究动机与目标
- 为解决生成式文本摘要中持续存在的实体幻觉问题,即模型生成源文档中不存在的实体。
- 开发可靠、自动的事实一致性度量,用于量化实体级别的事实一致性,且独立于ROUGE。
- 通过数据过滤、多任务学习和联合生成方法提升事实一致性,同时不牺牲ROUGE性能。
- 在标准新闻摘要数据集(XSUM、CNN/DailyMail和Newsroom)上评估这些方法的有效性。
提出的方法
- 提出精确率-源(prec_s)作为主要度量指标:prec_s = |摘要中的实体 ∩ 源文档中的实体| / |摘要中的实体|,用于衡量幻觉率。
- 引入精确率-目标(prec_t)和召回率-目标(recall_t),以在实体层面评估生成摘要与标准摘要的一致性。
- 应用现成的命名实体识别(SpaCy)与启发式规则进行实体匹配,支持n-gram、不区分大小写及停用词过滤的匹配方式。
- 实施一种简单的数据过滤技术,即移除摘要中包含源文档中未出现的实体的训练样本。
- 在训练过程中引入多任务学习设置,增加一个摘要关键实体分类头,以指导实体选择。
- 提出一种联合序列生成模型,可同时生成摘要和关键实体列表。
实验结果
研究问题
- RQ1SOTA生成式摘要模型(如BART)在多大程度上表现出实体级别的事实不一致?
- RQ2自动度量如prec_s、prec_t和recall_t能否可靠地量化生成摘要中的实体级别事实一致性?
- RQ3通过过滤训练数据以排除包含未登录词实体的摘要,是否能减少推理阶段的幻觉现象?
- RQ4在实体分类任务上引入多任务学习,是否能在不降低ROUGE分数的前提下提升实体级别的事实一致性?
- RQ5与标准自回归解码相比,联合生成实体和摘要的方法是否能进一步提升实体级别指标?
主要发现
- XSUM数据集中真实摘要存在较高程度的实体幻觉,平均prec_s低于94%。
- 仅通过数据过滤,XSUM测试集上的prec_s即从低于94%提升至98%以上,显著降低了幻觉现象。
- 增加多任务实体分类头后,prec_s及其他实体级别指标进一步提升,且未降低ROUGE分数。
- 联合生成实体与摘要的方法在实体级别指标上带来额外增益,尽管对ROUGE造成轻微损失。
- 对10个XSUM验证样本的手动评估确认了NER与匹配流程的高准确性,验证了所提度量的可靠性。
- 所提度量与方法在多个数据集(包括XSUM、CNN/DailyMail和Newsroom)上均有效,且在事实一致性方面保持一致的改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。