[论文解读] Batch Policy Gradient Methods for Improving Neural Conversation Models
本文提出批量策略梯度(BPG),一种用于在使用噪声大、成本高的人工标注奖励时改进神经对话模型的离策略、批量强化学习方法。通过利用未标注对话数据进行预训练,并在标注数据上应用策略梯度更新,BPG在餐厅推荐数据集上显著提升了响应质量,在亚马逊Mechanical Turk的评估中取得了具有统计显著性的提升。
We study reinforcement learning of chatbots with recurrent neural network architectures when the rewards are noisy and expensive to obtain. For instance, a chatbot used in automated customer service support can be scored by quality assurance agents, but this process can be expensive, time consuming and noisy. Previous reinforcement learning work for natural language processing uses on-policy updates and/or is designed for on-line learning settings. We demonstrate empirically that such strategies are not appropriate for this setting and develop an off-policy batch policy gradient method (BPG). We demonstrate the efficacy of our method via a series of synthetic experiments and an Amazon Mechanical Turk experiment on a restaurant recommendations dataset.
研究动机与目标
- 解决在客服场景中,使用有限、噪声较大的人工标注奖励训练神经对话模型的挑战。
- 开发一种适用于离线、批量学习的强化学习方法,其中无法与环境进行交互。
- 通过人类标注分数的弱监督,改进最大似然预训练模型的响应质量。
- 在策略迭代框架中高效利用未标注对话数据与标注奖励数据。
- 证明在低数据、高噪声环境下,离策略批量策略梯度方法优于在线策略和在线强化学习方法。
提出的方法
- 使用未标注对话数据,通过最大似然方法预训练序列到序列RNN策略。
- 应用批量策略梯度(BPG)算法,利用来自多个行为策略的历史轨迹执行离策略更新。
- 采用重要性采样,校正行为策略与目标策略之间在离策略更新中的分布偏移。
- 使用时序差分(GTD(λ))或常数估计器来估计价值函数 $\widehat{V}$,以稳定训练过程。
- 利用批量数据中完整的动作与奖励历史计算精确的策略梯度,实现更快收敛。
- 结合预训练与策略迭代,优化响应质量,鼓励生成更具意义和多样性的对话轮次。
实验结果
研究问题
- RQ1当奖励噪声大且获取成本高时,离策略批量策略梯度方法是否能有效提升神经对话模型的性能?
- RQ2在本场景中,使用未标注数据进行预训练、批量标注数据用于策略优化,是否能带来优于在线策略或在线强化学习方法的性能?
- RQ3BPG在响应质量方面与最大似然微调及其他基线方法相比如何?其结果是否具有统计显著性?
- RQ4重要性采样与价值函数估计在对话系统批量强化学习中,能在多大程度上提升样本效率与训练稳定性?
- RQ5BPG能否克服最大似然模型在开放域对话中生成通用或无帮助响应的倾向?
主要发现
- 经过BPG微调后,Bot-2的响应质量在统计上显著提升,配对t检验p值为0.00007,Wilcoxon符号秩检验p值为0.00017。
- Bot-1在Wilcoxon符号秩检验中也表现出显著改善(p = 0.07930),尽管t检验p值(0.10296)不显著,这可能是由于亚马逊Mechanical Turk上的标签噪声所致。
- Bot-2的人工评分均值从0.7009提升至0.7317,相对提升约4.4%。
- 该方法成功减少了如“让我查一下”和“稍等一下”等通用回复,转而鼓励生成更具上下文相关性和任务导向的回应。
- 利用未标注数据进行预训练、批量标注数据进行策略更新,即使监督信号有限,也能实现有效的策略改进。
- 结果表明,BPG优于最大似然微调,在真实世界客服应用中常见的低数据、高噪声设置下具有有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。