[论文解读] Unsupervised Reference-Free Summary Quality Evaluation via Contrastive Learning
本文提出一种无需参考文本的无监督摘要质量评估方法,利用对比学习同时评估摘要的语言质量和语义质量,无需人工参考。通过构建特定任务的负样本,并使用排序损失训练基于 BERT 的评估器,该方法在 Newsroom 和 CNN/Daily Mail 数据集上与人类判断的相关性达到最先进水平,展现出良好的跨数据集泛化能力。
Evaluation of a document summarization system has been a critical factor to impact the success of the summarization task. Previous approaches, such as ROUGE, mainly consider the informativeness of the assessed summary and require human-generated references for each test summary. In this work, we propose to evaluate the summary qualities without reference summaries by unsupervised contrastive learning. Specifically, we design a new metric which covers both linguistic qualities and semantic informativeness based on BERT. To learn the metric, for each summary, we construct different types of negative samples with respect to different aspects of the summary qualities, and train our model with a ranking loss. Experiments on Newsroom and CNN/Daily Mail demonstrate that our new evaluation method outperforms other metrics even without reference summaries. Furthermore, we show that our method is general and transferable across datasets.
研究动机与目标
- 开发一种无需人工标注参考文本的自动摘要评估指标。
- 通过联合建模语言质量(如流畅性、语法)和语义信息量(如相关性、冗余性)来提升评估性能。
- 通过对比学习实现无监督训练摘要评估器,无需人类评分或参考摘要。
- 确保该方法在无需微调的情况下可泛化至不同摘要数据集。
提出的方法
- 设计一个基于 BERT 的评估器,综合评估摘要的语言与语义质量。
- 通过在语言和语义维度上扰动摘要(如词语替换、句子重排、句子删除)构建多种类型的负样本。
- 使用对比学习框架与排序损失进行训练,最大化原始样本与负样本之间的得分差异。
- 使用文档级别的 BERT 嵌入作为语义监督信号,替代对参考摘要的依赖。
- 通过对比损失端到端优化模型,使高质量摘要在嵌入空间中更接近正样本锚点,而非任何负样本。
- 通过在一种数据集上训练并在另一种数据集上测试(无需微调)来实现跨数据集的可迁移性。
实验结果
研究问题
- RQ1无需参考的无监督方法能否在摘要评估中实现与人类判断的高相关性?
- RQ2对比学习能否在无须人工标注评分或参考摘要的情况下有效训练摘要评估器?
- RQ3与仅关注语义相似性的方法相比,联合建模语言与语义质量是否能提升评估性能?
- RQ4训练好的评估器能否在不重新训练的情况下泛化至不同摘要数据集?
主要发现
- 所提出的 LS_Score 方法在 Newsroom(总体相关性 0.6563)和 CNN/Daily Mail(总体相关性 0.3342)上均达到与人类判断最高的斯皮尔曼等级相关性,优于 ROUGE、BERTScore-R、MoverScore 和 BERT+Cos+Doc。
- 在 Newsroom 上,LS_Score 在信息量方面达到 0.7163 的相关性,在整体质量方面达到 0.6563,显著优于 BERTScore-R(分别为 0.2972 和 0.2787)。
- 在 CNN/Daily Mail 上,LS_Score 在流畅性方面达到 0.5933,在冗余性方面达到 0.2875,优于 BERT+Linear(0.4511 和 0.1664)和 BERTScore-R(0.2227 和 0.2780)。
- 消融实验证实,所提出的评估器结合对比学习框架优于标准的 BERT+Linear 基线,即使两者采用相同的对比设置。
- 跨数据集迁移实验表明,LS_Score_cross 保持了强劲性能(如在 Newsroom 上为 0.6271,在 CNN/Daily Mail 上为 0.2874),证明了该方法的泛化能力。
- 在 CNN/Daily Mail 上训练的模型可良好泛化至 Newsroom,反之亦然,表明其在不同数据集间具有稳健的可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。