[论文解读] Better Rewards Yield Better Summaries: Learning to Summarise Without References
本文提出了一种基于强化学习(RL)的文档摘要方法,该方法直接从2,500份摘要的人工评分中学习奖励函数,无需参考摘要。通过在文档-摘要对及其人类判断上训练神经网络奖励模型,该方法与人类偏好的相关性显著高于ROUGE,生成的摘要在人类评价中显著优于最先进的监督学习或ROUGE奖励的RL系统。
Reinforcement Learning (RL) based document summarisation systems yield state-of-the-art performance in terms of ROUGE scores, because they directly use ROUGE as the rewards during training. However, summaries with high ROUGE scores often receive low human judgement. To find a better reward function that can guide RL to generate human-appealing summaries, we learn a reward function from human ratings on 2,500 summaries. Our reward function only takes the document and system summary as input. Hence, once trained, it can be used to train RL-based summarisation systems without using any reference summaries. We show that our learned rewards have significantly higher correlation with human ratings than previous approaches. Human evaluation experiments show that, compared to the state-of-the-art supervised-learning systems and ROUGE-as-rewards RL summarisation systems, the RL systems using our learned rewards during training generate summarieswith higher human ratings. The learned reward function and our source code are available at https://github.com/yg211/summary-reward-no-reference.
研究动机与目标
- 为解决ROUGE在摘要层面与人类判断相关性差的问题,该问题误导了基于RL的摘要模型。
- 通过直接从生成摘要的人工评分中学习,构建与人类偏好相关性更高的奖励函数。
- 在不访问参考摘要的情况下训练基于RL的摘要模型,仅使用源文档和生成摘要作为输入。
- 证明所学习的奖励能提升抽取式和生成式摘要设置下的摘要质量。
提出的方法
- 使用来自500篇CNN/DailyMail文章的2,500份摘要的人工评分,仅以源文档和生成摘要作为输入,训练神经网络奖励模型。
- 将奖励学习问题建模为回归或偏好学习,采用多种文本编码器和神经架构。
- 使用所学习的奖励函数,在跨输入和输入特定设置下,训练抽取式和生成式基于RL的摘要模型。
- 通过人类评估对生成摘要的丰富性、简洁性、语法正确性以及与源文本的一致性进行评估。
- 将使用所学习奖励训练的RL智能体性能,与使用ROUGE和监督基线训练的模型进行比较。
- 使用基于偏好的反馈(如成对比较)作为全评分的更低成本替代方案,以实现高效的奖励学习。
实验结果
研究问题
- RQ1从人工评分中学习的奖励函数是否在摘要层面与人类判断的相关性显著高于ROUGE?
- RQ2在不使用参考摘要的情况下训练的奖励模型,是否仍能有效引导RL智能体生成更高质量的摘要?
- RQ3使用所学习奖励训练的基于RL的摘要模型在人类评估中的表现,与最先进的监督学习和ROUGE奖励系统相比如何?
- RQ4所学习的奖励在多大程度上减少了生成摘要中的冗余并提升了与源文本的一致性?
主要发现
- 所学习的奖励函数与人类判断的相关性显著高于ROUGE,尤其在ROUGE无法区分质量差异的摘要层面表现更优。
- 使用所学习奖励训练的RL摘要模型获得的人类评分为2.20,显著高于使用ROUGE作为奖励时获得的1.75(p = 0.0057)。
- 在基于偏好的评估中,使用所学习奖励的系统在75%的比较中更受青睐,而ROUGE奖励基线仅在15%的比较中更受青睐。
- 所学习的奖励减少了冗余:ROUGE奖励系统的摘要中有六处冗余,而所学习奖励系统的摘要中仅有两处。
- 该方法提升了摘要的一致性,减少了诸如时间或事件描述错误等幻觉现象。
- 该奖励模型在抽取式和生成式摘要中均具有泛化能力,在两种设置下均优于最先进的模型,且无需参考摘要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。