[论文解读] Improved Beam Search for Hallucination Mitigation in Abstractive Summarization
本文提出了一种基于NLI的束搜索重排序机制,通过在关键性增强的贪婪解码过程中计算输入上下文与中间束假设之间的蕴含分数,有效缓解了生成式摘要中的幻觉问题。该方法在XSum和CNN/DM数据集的人工评估中优于基线模型,显著提升了事实一致性,且无需模型微调或复杂后处理。
Advancement in large pretrained language models has significantly improved their performance for conditional language generation tasks including summarization albeit with hallucinations. To reduce hallucinations, conventional methods proposed improving beam search or using a fact checker as a postprocessing step. In this paper, we investigate the use of the Natural Language Inference (NLI) entailment metric to detect and prevent hallucinations in summary generation. We propose an NLI-assisted beam re-ranking mechanism by computing entailment probability scores between the input context and summarization model-generated beams during saliency-enhanced greedy decoding. Moreover, a diversity metric is introduced to compare its effectiveness against vanilla beam search. Our proposed algorithm significantly outperforms vanilla beam decoding on XSum and CNN/DM datasets.
研究动机与目标
- 为解决大型语言模型生成的生成式摘要中持续存在的幻觉问题。
- 开发一种可泛化的推理阶段方法,以缓解幻觉,且无需模型微调或外部事实核查流水线。
- 评估并揭示现有事实性评估基准(如FactCC、SummaC和QGQA)的局限性。
- 证明在束解码阶段计算的NLI蕴含分数可有效引导模型生成更符合事实的输出。
- 通过在公开摘要数据集上的人工评估验证该方法的有效性。
提出的方法
- 该方法使用关键性增强的贪婪解码生成中间束假设,聚焦于输入上下文中的显著部分。
- 在每个解码步骤中,模型计算当前部分摘要与输入上下文之间的自然语言蕴含(NLI)蕴含分数。
- 根据累积的NLI蕴含概率对束进行重排序,优先选择与输入语义支持度更高的假设。
- 该方法将NLI评分直接集成到束搜索中,仅在词元级别修改束概率,而不改变模型参数。
- 该方法设计为可轻松泛化至不同模型和数据集,且无需任务特定的微调。
- 该方法避免依赖启发式约束或事后事实核查,而是通过解码过程中的语义匹配来引导生成更符合事实的内容。
实验结果
研究问题
- RQ1在束解码过程中计算的NLI蕴含分数是否能有效减少生成式摘要中的幻觉?
- RQ2所提出的基于NLI的束搜索重排序与现有幻觉缓解基线方法相比,在事实一致性方面表现如何?
- RQ3当前的事实性评估基准在多大程度上无法检测真实世界摘要输出中的幻觉?
- RQ4一种通用的、推理阶段的方法是否能在不进行模型微调或架构修改的情况下提升事实一致性?
- RQ5在束级别集成NLI是否能生成比原始束搜索或PINOCCHIO更连贯且事实一致的摘要?
主要发现
- 所提出的基于NLI的束搜索重排序方法在XSum和CNN/DM数据集的人工评估中显著优于原始束搜索和PINOCCHIO。
- 人工评估者认为,使用该方法生成的摘要在事实一致性方面更优,且幻觉更少。
- 该方法在不同类型的输入和摘要长度下均表现出一致的改进,表明其具有强大的泛化能力。
- 研究发现,现有事实性评估基准(如FactCC、SummaC和QGQA)在检测复杂幻觉方面能力不足,尤其是在生成式摘要中。
- 消融实验中的示例表明,束级别NLI分数能成功将模型引导至事实支持的假设,即使初始束中包含幻觉内容。
- 该方法在不增加推理时间、不引入额外模型参数或微调的情况下,实现了事实一致性的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。