[论文解读] Answers Unite! Unsupervised Metrics for Reinforced Summarization Models
本文提出了一种基于无监督问答(QA)的评估指标,用于通过强化学习评估和训练生成式摘要模型,从而摆脱对参考摘要的依赖。该方法通过自监督方式利用领域内和领域外的无标签文本,在实现最先进ROUGE得分的同时,显著提升了人类评估中的相关性和可读性表现。
Abstractive summarization approaches based on Reinforcement Learning (RL) have recently been proposed to overcome classical likelihood maximization. RL enables to consider complex, possibly non-differentiable, metrics that globally assess the quality and relevance of the generated outputs. ROUGE, the most used summarization metric, is known to suffer from bias towards lexical similarity as well as from suboptimal accounting for fluency and readability of the generated abstracts. We thus explore and propose alternative evaluation measures: the reported human-evaluation analysis shows that the proposed metrics, based on Question Answering, favorably compares to ROUGE -- with the additional property of not requiring reference summaries. Training a RL-based model on these metrics leads to improvements (both in terms of human or automated metrics) over current approaches that use ROUGE as a reward.
研究动机与目标
- 解决ROUGE指标存在的局限性,即其偏向词汇相似性,且对摘要的流畅性和可读性考虑不足。
- 开发无需人工标注参考摘要的无监督评估指标,从而可广泛应用于无标签文本。
- 利用这些新指标训练基于强化学习的摘要模型,同时提升自动评估和人类评估得分。
- 探究使用所提出的基于问答的指标,在领域内和领域外原始文本上进行自监督预训练的有效性。
- 在相同的强化学习训练设置下,比较不同摘要架构在新指标下的性能表现。
提出的方法
- 提出一种基于问答的新评估指标,其中问题从输入文本自动生成,答案则从模型生成的摘要中抽取。
- 计算基于问答的F1分数(QA F1),作为摘要质量的代理指标,衡量生成摘要回答源自输入文档的问题的能力。
- 引入置信度指标(QA conf),用于评估模型对其答案的确定性,该指标用于优化强化学习训练中的奖励信号。
- 使用基于问答的指标作为主要奖励信号,训练生成式摘要模型,替代或补充ROUGE指标。
- 在无监督微调设置下,将模型应用于领域内(与测试集分布相同)和领域外(如TL;DR)数据。
- 采用双损失训练目标,结合ROUGE-L与QA F1,以平衡n-gram召回率与事实一致性,同时使用可学习系数实现最优加权。
实验结果
研究问题
- RQ1基于问答的指标能否作为ROUGE的有效、无参考替代方案,用于评估生成式摘要?
- RQ2使用基于问答的指标训练摘要模型,是否能同时提升自动评估(ROUGE)和人类评估指标?
- RQ3在基于问答奖励的引导下,使用领域内和领域外无标签文本进行自监督微调的效果如何?
- RQ4所提出的指标在预测人类对相关性和可读性判断方面表现如何?
- RQ5当使用基于问答的奖励进行训练时,See等人(2017)提出的架构是否在ROUGE和人类评估中优于Paulus等人(2017)的设置?
主要发现
- 所提出的基于问答的指标在ROUGE得分上达到或超过使用ROUGE训练的最先进模型水平,同时在人类评估的相关性和可读性方面实现显著提升。
- 使用基于问答奖励(尤其是QA learned)训练的模型,优于使用ROUGE与QA指标同等权重训练的模型,尤其在相关性和可读性方面表现更优。
- 使用相同领域(CNN-DM验证集)的无监督数据可带来可测量的摘要质量提升,且当训练数据分布与测试数据匹配时,提升最为显著。
- 在领域外TL;DR数据上使用基于问答奖励训练的模型,在ROUGE-L、QA F1(unsup)和QA conf(unsup)上均实现超过1个百分点的绝对提升,表明其具备强大的跨领域迁移能力。
- 人类评估显示,QA learned在可读性方面优于QA equally(p < 0.05),而QA equally在相关性方面表现更差,这是由于ROUGE-L权重过强所致,证实了奖励错位的风险。
- 结果表明,使用基于问答的指标在无标签数据上进行自监督预训练极具优势,可实现无需参考摘要的有效跨领域迁移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。