[论文解读] BRIO: Bringing Order to Abstractive Summarization
BRIO 提出了一种用于抽取式摘要生成的新型训练范式,该范式用基于对比学习的质量感知非确定性目标分布替代了最大似然估计的确定性目标分布,通过对比学习将概率质量分配给候选摘要。这种双重角色训练使 CNN/DailyMail 上的 ROUGE 分数提升至 47.78(ROUGE-1),XSum 上达到 49.07,同时提升了模型的校准能力并改善了摘要质量的相对排序。
Abstractive summarization models are commonly trained using maximum likelihood estimation, which assumes a deterministic (one-point) target distribution in which an ideal model will assign all the probability mass to the reference summary. This assumption may lead to performance degradation during inference, where the model needs to compare several system-generated (candidate) summaries that have deviated from the reference summary. To address this problem, we propose a novel training paradigm which assumes a non-deterministic distribution so that different candidate summaries are assigned probability mass according to their quality. Our method achieves a new state-of-the-art result on the CNN/DailyMail (47.78 ROUGE-1) and XSum (49.07 ROUGE-1) datasets. Further analysis also shows that our model can estimate probabilities of candidate summaries that are more correlated with their level of quality.
研究动机与目标
- 为解决最大似然估计在抽取式摘要生成中的局限性,该方法避免将参考摘要视为唯一正确输出,且无法对候选摘要进行质量排序。
- 通过使模型在推理阶段能够准确比较候选摘要的相对质量,提升模型性能,减轻暴露偏差的影响。
- 训练单一模型以同时承担双重角色:作为摘要生成模型和无参考摘要的评估模型。
- 增强模型预测概率与实际摘要质量指标(如 ROUGE)之间的对齐。
- 开发一种能更好校准模型置信度并提升对训练数据中噪声模式鲁棒性的训练范式。
提出的方法
- 用对比损失替代标准的最大似然估计(MLE)损失,以建模非确定性目标分布,根据候选摘要的质量分配概率质量。
- 使用预训练的抽取式模型(如 BART)在训练过程中为每个输入文档生成多样化的候选摘要。
- 应用对比学习,促使模型为质量更高的候选摘要分配更高的概率,其质量以 ROUGE 得分衡量。
- 采用双重目标进行模型训练:标准 MLE 用于参考摘要生成,对比损失用于候选摘要的相对质量排序。
- 将对比损失集成到训练过程中,而不修改自回归生成机制,实现端到端训练。
- 通过仅采样 100 或 1000 个样本,将方法扩展至少样本微调,证明其在极小数据量下的有效性。
实验结果
研究问题
- RQ1能否训练单一抽取式摘要模型,使其既能生成摘要,又能准确按质量对候选摘要进行排序?
- RQ2用非确定性分布替代确定性 MLE 是否能提升摘要质量与模型校准能力?
- RQ3对比损失在多大程度上改善了模型预测概率与候选摘要实际 ROUGE 得分之间的对齐?
- RQ4所提方法是否能在仅使用极少训练数据的少样本微调设置中实现泛化?
- RQ5模型是否学会过滤掉训练数据中的低质量或噪声模式(如 '点击此处' 链接)?
主要发现
- BRIO 在 CNN/DailyMail 数据集上取得 47.78 的 ROUGE-1 新 SOTA 结果,超越此前所有方法。
- 在 XSum 数据集上,BRIO 达到 49.07 的 ROUGE-1,创下新的 SOTA 性能。
- 模型在 CNNDM 上的相对排序准确率提升至 79.63%,显著优于 BART 的 54.80%,能更准确地为高质量摘要分配更高概率。
- BRIO-Mul 学会忽略摘要中的噪声模式(如 'click here'),而 BART 会错误地学习并生成这些内容。
- 模型表现出更好的校准性,尤其在 XSum 上,可靠性图显示其相比基线模型减少了过度自信现象。
- 在少样本微调中,BRIO-Few 仅使用 100 或 1000 个训练样本,就在 CNNDM 上实现 +1.52 的 ROUGE-1 提升,在 XSum 上实现 +0.49 的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。