[论文解读] COLO: A Contrastive Learning based Re-ranking Framework for One-Stage Summarization
CoLo 提出了一种基于对比学习的端到端重排序框架,用于单阶段文本摘要生成,直接优化摘要级别得分,无需额外模块,在 CNN/DailyMail 数据集上实现了 44.58(抽取式)和 46.33(生成式)的 SOTA ROUGE-1 分数,同时保持参数效率与推理效率,相比多阶段系统实现 3×–8× 的推理加速,并节省了超过 100 小时的 GPU 训练时间。
Traditional training paradigms for extractive and abstractive summarization systems always only use token-level or sentence-level training objectives. However, the output summary is always evaluated from summary-level which leads to the inconsistency in training and evaluation. In this paper, we propose a Contrastive Learning based re-ranking framework for one-stage summarization called COLO. By modeling a contrastive objective, we show that the summarization model is able to directly generate summaries according to the summary-level score without additional modules and parameters. Extensive experiments demonstrate that COLO boosts the extractive and abstractive results of one-stage systems on CNN/DailyMail benchmark to 44.58 and 46.33 ROUGE-1 score while preserving the parameter efficiency and inference efficiency. Compared with state-of-the-art multi-stage systems, we save more than 100 GPU training hours and obtaining 3~8 speed-up ratio during inference while maintaining comparable results.
研究动机与目标
- 弥合抽取式与生成式摘要中句子/词元级训练目标与摘要级评估之间的差距。
- 消除两阶段摘要系统中对独立重排序模块的依赖,同时保持或提升性能。
- 开发一种直接通过在线采样实现对比学习的单阶段框架,以直接优化摘要级得分。
- 在不牺牲模型质量的前提下实现高推理效率,支持实时部署。
- 证明通过对比学习实现的摘要级优化可超越传统的词元/句子级训练目标。
提出的方法
- 提出一种在线采样策略,在训练过程中动态地从模型自身的输出分布中生成正样本和负样本候选摘要,取代固定的离线采样。
- 采用对比学习目标,在嵌入空间中拉近高质量候选摘要(正样本对)并推远低质量候选摘要(负样本对)。
- 使用摘要级判别器(如 BERTScore、MoverScore、ROUGE)作为损失函数,直接优化模型生成高分摘要的能力。
- 将对比学习目标应用于抽取式与生成式模型,实现端到端训练,无需额外参数或模块。
- 利用 t-SNE 可视化证明,高质量候选摘要在语义空间中紧密聚集于锚点(输入文档)周围。
- 结合标准序列级损失(如 BCE、NLL)与对比损失进行联合训练,同时优化流畅性与摘要级质量。
实验结果
研究问题
- RQ1单阶段摘要模型是否能在不增加额外模块的前提下,实现与两阶段重排序系统相当的性能?
- RQ2通过在线采样的对比学习是否能有效优化摘要级评估指标,而无需依赖离线候选生成?
- RQ3与标准的词元/句子级训练相比,直接优化摘要级得分是否能提升 ROUGE 和人工评估指标?
- RQ4CoLo 在提升摘要质量的同时,能在多大程度上保持推理效率?
- RQ5不同神经评估指标(如 BERTScore、MoverScore)如何影响对比重排序框架的性能与训练成本?
主要发现
- CoLo 在 CNN/DailyMail 抽取式摘要基准上达到 44.58 的 ROUGE-1 分数,超越了以往所有单阶段模型,并与两阶段系统相当或更优。
- 在生成式摘要任务中,CoLo 达到 46.33 的 ROUGE-1 分数,展现出在具有挑战性的基准上的强大性能。
- 模型在单张 GPU 上保持了约 42.0 个样本/秒的高推理速度,相比两阶段系统(约 7.0 个样本/秒)实现 3×–8× 的加速。
- 使用 BERTScore 作为判别器时,人工评估结果最佳,平均排名为 2.90,优于所有其他自动系统。
- t-SNE 可视化结果证实,高质量候选摘要在语义空间中紧密聚集于输入嵌入周围,验证了对比学习目标的有效性。
- 使用 BERTScore 和 MoverScore 等神经度量作为判别器的训练可显著提升性能,尽管会增加训练时间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。