Skip to main content
QUICK REVIEW

[论文解读] Towards the Use of Deep Reinforcement Learning with Global Policy For Query-based Extractive Summarisation

Diego Mollá|arXiv (Cornell University)|Nov 10, 2017
Topic Modeling参考文献 8被引用 4
一句话总结

本文提出一种基于全局策略的深度强化学习方法,用于基于查询的抽取式摘要生成,使用ROUGE-L分数作为最终奖励,直接优化摘要质量。通过使用未折扣奖励的策略梯度方法训练一个简单的神经网络策略,模型学会选择能最大化最终摘要性能的句子,在测试数据上实现了更高的ROUGE-L分数,尽管特征简单且训练数据有限。

ABSTRACT

Supervised approaches for text summarisation suffer from the problem of mismatch between the target labels/scores of individual sentences and the evaluation score of the final summary. Reinforcement learning can solve this problem by providing a learning mechanism that uses the score of the final summary as a guide to determine the decisions made at the time of selection of each sentence. In this paper we present a proof-of-concept approach that applies a policy-gradient algorithm to learn a stochastic policy using an undiscounted reward. The method has been applied to a policy consisting of a simple neural network and simple features. The resulting deep reinforcement learning system is able to learn a global policy and obtain encouraging results.

研究动机与目标

  • 解决监督式摘要中单句标注与最终摘要评估之间的不匹配问题。
  • 实现端到端训练,直接优化最终摘要的ROUGE-L分数,而非依赖句子级标签。
  • 开发一种可泛化于多种输入的全局策略,避免为每个摘要重新训练。
  • 证明在抽取式摘要中,使用直接ROUGE-L奖励的深度强化学习框架的可行性。
  • 探索在强化学习设置中使用简单特征和最小化神经网络进行摘要生成的潜力。

提出的方法

  • 环境在句子选择过程中给予零奖励,最终返回完整摘要的ROUGE-L分数作为最终奖励。
  • 使用前馈神经网络建模随机策略,输出每个句子被选中的概率。
  • 采用REINFORCE算法的变体进行策略训练,通过最终ROUGE-L奖励缩放交叉熵梯度。
  • 训练期间通过衰减的扰动促进探索,应用于动作的伯努利采样。
  • 网络使用简单特征(如句子与查询的相似度、TF-IDF)表示状态,不包含位置或长度信息。
  • 训练完成后,推理阶段对每句话采用最高概率的动作,实现快速摘要生成。

实验结果

研究问题

  • RQ1深度强化学习模型能否学会一种全局策略,直接在抽取式摘要中优化ROUGE-L分数?
  • RQ2仅使用基础特征的简单神经网络策略,在生成高ROUGE分数摘要方面效果如何?
  • RQ3与近似奖励相比,使用实际ROUGE-L分数作为最终奖励是否能提升性能?
  • RQ4全局策略能否在无需重新训练的情况下泛化到未见过的查询和文档?
  • RQ5当状态表示中排除关键摘要线索(如句子位置)时,模型表现如何?

主要发现

  • 模型成功学习到一种全局策略,在训练和测试数据上均提升了ROUGE-L分数,表明其泛化能力超越了训练分布。
  • 训练过程显示,在200,000个训练步长内,平均ROUGE-L分数稳步提升,测试性能同步上升。
  • 大约在200,000个训练步长后开始出现过拟合,表明需要正则化或早停策略。
  • 尽管仅使用基础特征和简单网络,模型仍取得令人鼓舞的结果,证明了直接ROUGE-L优化的可行性。
  • 初步实验表明,在状态表示中加入摘要长度可能加快收敛速度并提升最终性能。
  • 使用未折扣奖励和策略梯度方法,实现了有效的端到端训练,无需依赖代理的句子级标签。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。