[论文解读] Don't Say What You Don't Know: Improving the Consistency of Abstractive Summarization by Constraining Beam Search
本文提出 Pinocchio,一种通过约束生成标记以使其更可能得到源文本支持的束搜索解码方法,从而提升抽取式摘要的一致性。通过使用注意力、置信度和频率启发式方法检测并回溯幻觉生成,Pinocchio 在两个数据集上将一致性提升 68%,同时仅造成极少的流畅性损失,且无需额外训练。
Abstractive summarization systems today produce fluent and relevant output, but often "hallucinate" statements not supported by the source text. We analyze the connection between hallucinations and training data, and find evidence that models hallucinate because they train on target summaries that are unsupported by the source. Based on our findings, we present PINOCCHIO, a new decoding method that improves the consistency of a transformer-based abstractive summarizer by constraining beam search to avoid hallucinations. Given the model states and outputs at a given step, PINOCCHIO detects likely model hallucinations based on various measures of attribution to the source text. PINOCCHIO backtracks to find more consistent output, and can opt to produce no summary at all when no consistent generation can be found. In experiments, we find that PINOCCHIO improves the consistency of generation (in terms of F1) by an average of~67% on two abstractive summarization datasets.
研究动机与目标
- 通过分析训练数据中与源文本不一致的摘要,探究抽取式摘要模型产生幻觉的原因。
- 解决在使用银标准、不一致摘要进行训练的模型中,幻觉现象的根本原因。
- 开发一种解码方法,在不重新训练或引入额外模型的前提下提升摘要一致性。
- 引入一个新的抽取式摘要数据集——科学概念描述(Scientific Concept Description, SCD),用于科学概念摘要任务。
- 在包括科学文献在内的多样化领域中评估该方法,以检验其鲁棒性和泛化能力。
提出的方法
- Pinocchio 通过使用注意力分布和模型置信度分数,过滤掉被认为不太可能得到源文本支持的生成标记,从而对束搜索进行约束。
- 在解码过程中,基于词频和注意力集中度的启发式方法,估算每个候选标记的源文本支持程度。
- 当在某一步解码中无法找到被支持的标记时,Pinocchio 会回溯到先前的状态,探索其他生成路径。
- 如果无法找到一致的输出,该方法可以选择完全不生成摘要,从而避免产生幻觉内容。
- 它作为一种后处理解码技术运行,无需对基础模型进行重新训练或微调。
- 该方法在两个抽取式摘要数据集和一个新的包含 60,000 个样本的科学概念描述(SCD)数据集上进行了评估。
实验结果
研究问题
- RQ1包含与源文本不一致摘要的训练数据在多大程度上导致了抽取式摘要模型的幻觉?
- RQ2是否可以通过约束束搜索在不重新训练或使用外部模型的情况下提升摘要一致性?
- RQ3模型在输出中倾向于选择高频 n-gram 的倾向,与幻觉现象之间存在何种关联?
- RQ4该方法是否能在包括科学文本在内的多样化领域中提升摘要一致性?
- RQ5自动指标(如 ROUGE)与事实一致性之间的相关性如何?它们是否可能具有误导性?
主要发现
- Pinocchio 在 CNN/DM 和 XSUM 数据集上平均将摘要一致性提升 68%,且对流畅性影响极小。
- 该方法通过利用注意力和置信度启发式方法检测并回溯不被支持的标记预测,显著减少了幻觉现象。
- BART 生成的摘要中 n-gram 分布的尾部不那么显著,表明其存在对高频、听起来可信短语的偏向。
- 在抽取式数据集中,有 18% 至 24% 的目标摘要与源文本不一致,表明数据收集过程本身可能是根本原因。
- SCD 数据集包含 60,000 个样本和 118,000 篇论文引用,为科学概念摘要任务提供了具有挑战性的新基准。
- Pinocchio 的性能对模型特定设置敏感,且未经调整无法直接推广至 PEGASUS 等其他模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。