[论文解读] SimCLS: A Simple Framework for Contrastive Learning of Abstractive Summarization
SimCLS 提出了一种两阶段框架用于抽取式摘要生成,通过对比学习将文本生成与质量评分解耦,显著提升了 ROUGE 分数。通过在候选摘要上使用对比学习训练独立的评分模型,其在 CNN/DailyMail 数据集上相较于 BART 提升了 2.51 的 ROUGE-1 分数,相较于 PEGASUS 提升了 2.50,有效缩小了训练目标与评估指标之间的差距。
In this paper, we present a conceptually simple while empirically powerful framework for abstractive summarization, SimCLS, which can bridge the gap between the learning objective and evaluation metrics resulting from the currently dominated sequence-to-sequence learning framework by formulating text generation as a reference-free evaluation problem (i.e., quality estimation) assisted by contrastive learning. Experimental results show that, with minor modification over existing top-scoring systems, SimCLS can improve the performance of existing top-performing models by a large margin. Particularly, 2.51 absolute improvement against BART and 2.50 over PEGASUS w.r.t ROUGE-1 on the CNN/DailyMail dataset, driving the state-of-the-art performance to a new level. We have open-sourced our codes and results: https://github.com/yixinL7/SimCLS. Results of our proposed models have been deployed into ExplainaBoard platform, which allows researchers to understand our systems in a more fine-grained way.
研究动机与目标
- 解决抽取式摘要中训练目标(如最大似然估计 MLE)与评估指标(如 ROUGE)之间的不一致问题。
- 通过将生成过程与质量评分解耦,缓解自回归生成中的暴露偏差与错误累积问题。
- 直接利用对比学习优化整体摘要质量,避免使用不稳定强化学习方法。
- 证明当通过学习到的评分模型进行评估时,候选摘要可显著优于原始模型输出。
- 为超越最大似然估计的指标导向训练开辟新方向。
提出的方法
- 两阶段框架:首先,使用预训练的序列到序列模型(如 BART 或 PEGASUS)通过束搜索生成多个候选摘要。
- 其次,训练一个无需参考摘要的评估模型(如 RoBERTa),利用对比学习对候选摘要进行评分。
- 对比学习使用正样本对(候选摘要与参考摘要)和负样本对(候选摘要与非参考摘要)来优化评分模型。
- 评分模型被训练为最大化候选摘要与参考摘要之间的相似性,同时最小化其与非参考候选摘要之间的相似性。
- 通过多样化束搜索生成候选摘要,以提升多样性并改善训练信号的质量。
- 最终摘要基于训练好的评估模型预测的最高分选出,而非原始模型的输出。
实验结果
研究问题
- RQ1一种将生成与评估解耦的两阶段框架是否能提升抽取式摘要的性能?
- RQ2对比学习在多大程度上能够弥合训练目标与基于 ROUGE 的评估指标之间的差距?
- RQ3使用对比学习进行无参考质量评分是否能减少长文档中的位置偏差?
- RQ4当通过学习到的评分模型进行评估时,序列到序列模型生成的候选摘要是否能显著优于原始模型的输出?
- RQ5该方法在不同数据集(如 XSum 这类生成更短、更抽象摘要的数据集)上是否具有良好的泛化能力?
主要发现
- 在 CNN/DailyMail 数据集上,SimCLS 相较于 BART 提升了 2.51 的绝对 ROUGE-1 分数,相较 PEGASUS 提升了 2.50,创下新的 SOTA 记录。
- 在 XSum 数据集上,SimCLS 将 ROUGE-L 提升 0.19 分(从 39.23 提升至 39.44),ROUGE-1 提升 0.50 分(从 47.10 提升至 47.61),且具有统计显著性(p < 0.05)。
- 该方法减少了位置偏差:与基线模型倾向于偏好长文档中开头句子不同,SimCLS 更贴近参考摘要中句子的实际位置。
- 通过多样化束搜索生成的候选摘要,经由对比模型评估后,始终优于原始模型的输出,表明原始模型常未能发挥其生成潜力。
- 该框架证明,一个独立训练的对比模型可有效识别出更高质量的摘要,且在推理阶段无需访问真实参考摘要。
- 该方法在不同基础模型上均表现稳健,应用于 BART 和 PEGASUS 时,在 CNN/DailyMail 和 XSum 数据集上均实现了稳定提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。