Skip to main content
QUICK REVIEW

[论文解读] Summary Level Training of Sentence Rewriting for Abstractive Summarization

Sanghwan Bae, Taeuk Kim|arXiv (Cornell University)|Sep 19, 2019
Topic Modeling参考文献 44被引用 8
一句话总结

本文提出了一种新颖的强化学习框架用于抽象式摘要生成,直接优化摘要级别的ROUGE得分,通过基于BERT的句子抽取和奖励塑造来解决训练目标与评估指标之间的不匹配问题。该方法在CNN/Daily Mail和NYT数据集上取得了最先进性能,ROUGE-L得分显著提升,并在DUC-2002数据集上展现出更优的泛化能力。

ABSTRACT

As an attempt to combine extractive and abstractive summarization, Sentence Rewriting models adopt the strategy of extracting salient sentences from a document first and then paraphrasing the selected ones to generate a summary. However, the existing models in this framework mostly rely on sentence-level rewards or suboptimal labels, causing a mismatch between a training objective and evaluation metric. In this paper, we present a novel training signal that directly maximizes summary-level ROUGE scores through reinforcement learning. In addition, we incorporate BERT into our model, making good use of its ability on natural language understanding. In extensive experiments, we show that a combination of our proposed model and training procedure obtains new state-of-the-art performance on both CNN/Daily Mail and New York Times datasets. We also demonstrate that it generalizes better on DUC-2002 test set.

研究动机与目标

  • 解决抽象式摘要生成中句子级训练奖励与摘要级评估指标之间的不匹配问题。
  • 通过利用BERT的表征学习能力提升句子抽取性能,实现更优的显著性检测。
  • 在训练过程中直接优化摘要级ROUGE得分,利用强化学习提升整体摘要质量和流畅性。
  • 通过更好的训练信号对齐,提升模型在分布外数据集(如DUC-2002)上的泛化能力。
  • 展示将预训练语言模型与摘要生成指标的全局优化相结合的有效性。

提出的方法

  • 提出两阶段架构:基于BERT的提取器从文档中选择关键句子,随后由摘要器将这些句子重写为摘要。
  • 使用摘要级ROUGE F1得分作为强化学习的奖励信号,直接优化最终评估指标。
  • 通过奖励塑造缓解稀疏训练信号问题,在每一步句子选择过程中提供中间奖励,同时保持最优策略不变。
  • 使用策略梯度方法对提取器进行微调,采用摘要级奖励进行端到端优化,实现整个摘要生成流程的联合优化。
  • 在提取器中使用BERT进行句子编码,利用其在自然语言理解任务中的优异表现。
  • 在CNN/Daily Mail和NYT数据集上使用强化学习进行模型训练,并在同分布和分布外基准上进行评估。

实验结果

研究问题

  • RQ1与句子级奖励训练相比,直接优化摘要级ROUGE得分是否能提升抽象式摘要生成性能?
  • RQ2将BERT集成到句子抽取模块中是否能提升显著性检测能力并改善整体摘要质量?
  • RQ3奖励塑造是否能有效缓解强化学习中句子选择任务的摘要级奖励稀疏性问题?
  • RQ4与之前的最先进模型相比,该方法在分布外数据集(如DUC-2002)上是否展现出更好的泛化能力?
  • RQ5该模型在ROUGE-L得分上的提升程度如何,该指标反映了摘要的流畅性与连贯性?

主要发现

  • 所提模型在CNN/Daily Mail数据集上达到新的最先进性能,ROUGE-L F1得分为43.38,超越了包括BERTSUM和Two-Stage BERT在内的所有先前方法。
  • 在纽约时报(NYT50)数据集上,模型ROUGE-L F1得分为43.38,优于所有抽取式和生成式基线模型,仅在ROUGE-1上略逊于Liu(2019)的结果。
  • 与非强化学习基线相比,模型在ROUGE得分上提升了2个百分点,证明了强化学习训练过程的有效性。
  • 在DUC-2002测试集上,模型ROUGE-L F1得分为40.14,显著优于先前模型,表明其具备出色的泛化能力和鲁棒性。
  • 通过Amazon Mechanical Turk进行的人工评估显示,与Chen和Bansal(2018)以及Liu(2019)相比,该模型在相关性方面显著更优(p<0.05),在可读性方面无显著差异。
  • 结果表明,将BERT与摘要级强化学习训练相结合可带来显著的性能提升,尤其在流畅性与冗余性降低方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。