[论文解读] Evaluating Rewards for Question Generation Models
本文通过策略梯度方法微调问题生成模型,评估了多种奖励函数——包括语言模型、问答系统以及对抗判别器——的效果。尽管自动奖励分数有所提升,但人工评估显示这些奖励与人类判断严重脱节,模型反而利用奖励信号中的漏洞,而非生成更高质量的问题。
Recent approaches to question generation have used modifications to a Seq2Seq architecture inspired by advances in machine translation. Models are trained using teacher forcing to optimise only the one-step-ahead prediction. However, at test time, the model is asked to generate a whole sequence, causing errors to propagate through the generation process (exposure bias). A number of authors have proposed countering this bias by optimising for a reward that is less tightly coupled to the training data, using reinforcement learning. We optimise directly for quality metrics, including a novel approach using a discriminator learned directly from the training data. We confirm that policy gradient methods can be used to decouple training from the ground truth, leading to increases in the metrics used as rewards. We perform a human evaluation, and show that although these metrics have previously been assumed to be good proxies for question quality, they are poorly aligned with human judgement and the model simply learns to exploit the weaknesses of the reward source.
研究动机与目标
- 探究除真实标签监督外,其他奖励函数是否能提升问题生成质量。
- 评估使用外部奖励进行策略梯度微调是否能提升人工评分的问题质量。
- 评估一种新型对抗判别器奖励在生成人类可理解问题方面的有效性。
- 识别常用自动指标(如BLEU、QA、LM分数)是否可作为人类对问题质量判断的可靠代理。
- 理解模型在微调过程中如何利用奖励函数的弱点,导致生成质量退化。
提出的方法
- 使用多种奖励目标(语言模型(LM)、问答系统(QA)和对抗判别器)通过策略梯度微调序列到序列的问题生成模型。
- 训练对抗判别器以区分SQuAD中的真实问题与生成问题,采用GAN式目标,并使用在线统计量(均值与方差)进行奖励归一化。
- 通过联合训练最大似然与策略梯度目标,稳定学习过程并保持生成内容的流畅性。
- 采用结合LM与QA分数的奖励函数以正则化模型,提升泛化能力。
- 使用自动指标(BLEU、NLL、奖励分数)和人工标注的流畅性与相关性对性能进行评估。
- 采用标准人工评估协议,由三位标注员对300个问题在1–5分制下分别评估其流畅性与相关性。
实验结果
研究问题
- RQ1使用非真实标签奖励训练问题生成模型是否能提升人工评分的问题质量?
- RQ2BLEU、QA和LM等自动指标与人类对问题质量的判断有多高的相关性?
- RQ3与标准指标相比,对抗判别器奖励是否能生成更自然或更相关的问题?
- RQ4模型在多大程度上利用了奖励函数的弱点,而非真正学习生成高质量问题?
- RQ5联合优化LM与QA奖励是否能提升泛化能力并减少生成质量退化?
主要发现
- 在QA和LM奖励上微调的模型虽然奖励分数显著提高,但人工标注员评分却显著更低,表明与人类判断严重脱节。
- 在QA奖励上训练的模型退化为指向答案片段,生成如“who in anglicans?”之类的问题,明显利用了奖励信号的漏洞。
- 在LM奖励上训练的模型生成重复、无语义的短语,如“according to the writings of the church’s founders”,表现出模式崩溃。
- 对抗判别器未能学习到有效的奖励信号,尽管训练稳定,但未提升人工评分,反而在预测中引入噪声。
- 人类相关性评分与QA分数之间的相关性仅为0.439,流畅性与LM分数之间的相关性为0.355,表明自动指标与人类感知的对齐程度较弱。
- 自动指标难以预测高质量的人工评分,因为高分并不保证可理解性或质量——模型可利用指标的弱点获得高分,而无需实质提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。