[论文解读] mFACE: Multilingual Summarization with Factual Consistency Evaluation
该论文提出 mFACE,一种多语言抽象摘要框架,通过使用多语言自然语言蕴涵(NLI)模型提升事实一致性。它采用两种方法——数据过滤(仅在 NLI 模型预测为蕴涵的样本上进行训练)和受控生成(在解码过程中以 NLI 信号为条件)——以减少幻觉现象,在 XLSum 数据集的 45 种语言上显著提升了忠实度,自动评估与人工评估均证实摘要质量得到改善。
Abstractive summarization has enjoyed renewed interest in recent years, thanks to pre-trained language models and the availability of large-scale datasets. Despite promising results, current models still suffer from generating factually inconsistent summaries, reducing their utility for real-world application. Several recent efforts attempt to address this by devising models that automatically detect factual inconsistencies in machine generated summaries. However, they focus exclusively on English, a language with abundant resources. In this work, we leverage factual consistency evaluation models to improve multilingual summarization. We explore two intuitive approaches to mitigate hallucinations based on the signal provided by a multilingual NLI model, namely data filtering and controlled generation. Experimental results in the 45 languages from the XLSum dataset show gains over strong baselines in both automatic and human evaluation.
研究动机与目标
- 为解决多语言抽象摘要模型中事实不一致(幻觉)这一关键问题。
- 探究通过多语言 NLI 进行事实一致性评估是否能提升低资源与高资源语言的摘要性能。
- 利用强大的多语言 NLI 模型分析 XLSum 多语言摘要数据集中事实不一致的程度。
- 开发并评估两种实用方法——基于 NLI 信号的数据过滤与受控生成,以提升摘要忠实度。
- 发布人工标注的判断结果与模型,以支持未来在多语言事实一致性评估方面的研究。
提出的方法
- 在 XNLI 基准上微调多语言 NLI 模型,以评估输入文档与生成摘要之间的事实一致性。
- 应用 NLI 模型评估 XLSum 数据集中所有训练样本,识别并过滤掉事实不一致的摘要。
- 通过仅在 NLI 模型预测为‘蕴涵’的输入-摘要对上训练摘要模型,实现数据过滤。
- 在解码过程中以 NLI 模型的预测结果(蕴涵或矛盾)为条件,实现受控生成。
- 利用 NLI 模型的置信度分数指导训练与推理,提升忠实度,而无需重新训练主摘要模型。
- 在 45 种语言中收集人工判断,以评估摘要质量、事实一致性与信息量,并基于这些标注训练自动指标。
实验结果
研究问题
- RQ1在不同语言中,XLSum 多语言摘要数据集中的事实不一致问题有多严重?
- RQ2多语言 NLI 模型能否有效检测并过滤事实不一致的训练样本,从而提升摘要质量?
- RQ3在解码过程中以 NLI 预测结果(蕴涵/矛盾)为条件,是否能使摘要更忠实、更准确,相比标准训练方法?
- RQ4所提出的两种方法(过滤与受控生成)在多种语言中对自动评估与人工评估指标的提升程度如何?
- RQ5能否利用 45 种语言中的人工标注判断,训练出可靠的自动指标,以评估多语言摘要中的事实一致性?
主要发现
- 根据多语言 NLI 模型的评估,XLSum 数据集中某些语言的训练样本中高达 70% 存在事实不一致,凸显了严重的数据质量问题。
- 使用 NLI 模型进行数据过滤显著提升了事实一致性,人工评估显示其忠实度优于原始基线模型。
- 受控生成方法通过在生成过程中引入 NLI 信号,进一步提升了摘要质量,尤其在减少幻觉的同时保持了信息量。
- 在 45 种语言中,过滤与受控生成的结合方法在自动(ROUGE)与人工评估中均优于强基线模型。
- 基于 45 种语言中收集的人工判断,训练出的自动指标与人工评估在质量、事实一致性与信息量方面具有良好的相关性。
- 作者发布了其多语言 NLI 模型、摘要模型及人工判断数据,以支持未来在多语言事实一致性评估方面的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。