Skip to main content
QUICK REVIEW

[论文解读] Learning by Semantic Similarity Makes Abstractive Summarization Better

Wonjin Yoon, Yoon Sun Yeo|arXiv (Cornell University)|Feb 18, 2020
Topic Modeling参考文献 30被引用 19
一句话总结

本文研究了为何像 BART 这类生成式摘要模型在人类评估中表现优于 CNN/DailyMail 数据集中的参考摘要,尽管其训练数据来自该数据集。通过众包人类评估,作者发现模型生成的摘要在可读性、相关性和创造性方面得分显著高于参考摘要,这挑战了‘参考摘要为最优’的假设。关键洞见是:使用交叉熵损失的最大似然训练会惩罚语义有效但不完全相同的摘要,而基于语义相似度的目标函数则能更好地与人类判断对齐。

ABSTRACT

By harnessing pre-trained language models, summarization models had rapid progress recently. However, the models are mainly assessed by automatic evaluation metrics such as ROUGE. Although ROUGE is known for having a positive correlation with human evaluation scores, it has been criticized for its vulnerability and the gap between actual qualities. In this paper, we compare the generated summaries from recent LM, BART, and the reference summaries from a benchmark dataset, CNN/DM, using a crowd-sourced human evaluation metric. Interestingly, model-generated summaries receive higher scores relative to reference summaries. Stemming from our experimental results, we first argue the intrinsic characteristics of the CNN/DM dataset, the progress of pre-trained language models, and their ability to generalize on the training data. Finally, we share our insights into the model-generated summaries and presents our thought on learning methods for abstractive summarization.

研究动机与目标

  • 调查最先进的生成式摘要模型(如 BART)为何在人类评估中生成的摘要优于 CNN/DailyMail 数据集中的官方参考摘要。
  • 挑战‘参考摘要代表文本摘要质量上限’的假设。
  • 分析 CNN/DailyMail 数据集的内在特性及其对模型性能与评估的影响。
  • 提出从严格的自回归交叉熵训练转向基于语义相似度的目标函数,以更好地捕捉有效的改写形式。
  • 倡导改进评估标准,优先考虑语义相似度而非 n-gram 重叠,尤其适用于开放式生成任务。

提出的方法

  • 使用三种标准(创造性、可读性、相关性)对 BART 生成的摘要与 CNN/DailyMail 数据集中的参考摘要进行众包人类评估。
  • 通过自动指标(ROUGE)与人类判断对比,识别两者之间的差异。
  • 分析模型预测与参考摘要,识别出语义有效但因交叉熵损失被惩罚的改写形式。
  • 发现 BART 的编码器-解码器架构结合预训练语言表示,可提升句子流畅性与关键信息提取能力,从而提高可读性与相关性得分。
  • 提出用基于语义相似度的目标函数替代严格的自回归训练,以减少对有效改写的惩罚。
  • 因实现缺陷排除了其自身模型(semsim),转而聚焦于利用人类评估数据对 BART 与参考摘要进行分析。

实验结果

研究问题

  • RQ1为何 BART 生成的摘要在 CNN/DailyMail 数据集中的人类评估中得分高于参考摘要?
  • RQ2自动指标(如 ROUGE)在生成式摘要任务中与人类判断的相关性有多大?
  • RQ3使用像 BART 这类预训练语言模型如何影响生成摘要的质量,相较于参考摘要?
  • RQ4当存在多个有效改写形式时,序列到序列摘要中使用交叉熵损失存在哪些局限性?
  • RQ5如何改进评估标准,使其更能反映语义有效性而非 n-gram 重叠?

主要发现

  • BART 生成的摘要在所有三项标准(创造性、可读性、相关性)上的人类评估得分均显著高于参考摘要。
  • 模型生成摘要的平均可读性得分为近 80 分(满分 100),表明其语言流畅自然,属于人类评估中的高分水平。
  • 尽管训练数据来自 CNN/DailyMail 数据集,BART 生成的摘要仍优于官方参考摘要,挑战了‘参考摘要为最优’的假设。
  • 研究发现,交叉熵损失会惩罚语义有效但不完全相同的摘要(如改写句),即使其在事实和语境上均准确,仍被视为错误。
  • 结果表明,CNN/DailyMail 数据集的内在特性(如参考摘要质量较低或存在冗余)可能是导致模型性能超越参考摘要的原因之一。
  • 作者得出结论:基于语义相似度的训练目标可通过允许多种有效改写形式,更好地与人类判断对齐,同时减少因严格精确匹配惩罚带来的训练噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。