[论文解读] Reinforced Extractive Summarization with Question-Focused Rewards
本文提出了一种基于强化学习的抽取式摘要框架,将人类摘要转化为Cloze风格的问题,以训练生成流畅、简洁且事实准确的摘要。通过优化问答性能与摘要之间的词汇重叠,该方法在标准基准上超越了当前最先进模型,展现出更优的事实一致性与摘要质量。
We investigate a new training paradigm for extractive summarization. Traditionally, human abstracts are used to derive goldstandard labels for extraction units. However, the labels are often inaccurate, because human abstracts and source documents cannot be easily aligned at the word level. In this paper we convert human abstracts to a set of Cloze-style comprehension questions. System summaries are encouraged to preserve salient source content useful for answering questions and share common words with the abstracts. We use reinforcement learning to explore the space of possible extractive summaries and introduce a question-focused reward function to promote concise, fluent, and informative summaries. Our experiments show that the proposed method is effective. It surpasses state-of-the-art systems on the standard summarization dataset.
研究动机与目标
- 解决传统抽取式摘要方法依赖不完美人类摘要作为监督信号所带来的局限性。
- 通过将摘要与源自人类摘要的Cloze问题对齐,提升抽取式摘要的事实一致性与流畅性。
- 探究问答监督是否能比标准标签监督更有效地引导关键内容的选择。
- 评估不同问题生成策略(实体导向 vs. 关键词导向)对摘要与问答性能的影响。
- 开发一种训练范式,促使摘要在保留对问答有用内容的同时,保持与摘要的词汇相似性。
提出的方法
- 通过将关键实体或关键词替换为空白,将人类摘要转化为Cloze风格的问题。
- 使用带有指针-生成网络的序列到序列模型,从源文档生成抽取式摘要。
- 采用注意力机制,将摘要片段与相关问题对齐,支持多跳推理。
- 设计一种聚焦问答的奖励函数,结合流畅性、与摘要的词汇重叠以及问答性能,以指导强化学习。
- 通过策略梯度方法(如REINFORCE)训练模型,以最大化在多个问答对上的期望奖励。
- 同时使用基于实体和基于关键词的答案,构建多样化的问答对,并评估其对训练的影响。
实验结果
研究问题
- RQ1基于人类摘要生成的Cloze风格问题来训练抽取式摘要模型,是否能产生更准确且忠实的摘要?
- RQ2在实体导向与关键词导向的问题生成之间进行选择,如何影响摘要与问答性能?
- RQ3与标准监督相比,引入问答目标是否能提升抽取式摘要的事实一致性与信息量?
- RQ4在奖励函数中,每篇文档包含多少组问答对为最优?
- RQ5在推理阶段无法访问问题的情况下,一个为问答性能训练的摘要是否仍可作为通用摘要的可靠文档代理?
主要发现
- 所提方法在标准基准数据集上优于当前最先进抽取式摘要模型,展现出更优的事实一致性与流畅性。
- 在Cloze问题中使用基于关键词的答案,相比基于实体的答案,泛化能力更强,且训练与验证集之间的准确率差距更小。
- 每篇文档的问答对数量从K=1增加到K=5,使答案空间几乎翻倍(从23.7K增至50.3K),但对R-2得分的提升并不显著。
- 每篇文档使用K=1组问答对的模型在R-2 F-score上表现最佳,表明在短文档中,更多问题并不总是能提升摘要质量。
- 该系统生成的摘要在语义上与人类摘要接近,可叠加于源文本之上,完整保留事实内容且无幻觉现象。
- 该框架可生成作为问答有效代理的摘要,即使在推理阶段未提供问题,也能有效支持多样问题的问答。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。