[论文解读] JoTR: A Joint Transformer and Reinforcement Learning Framework for Dialog Policy Learning
JoTR 提出了一种新颖的联合 Transformer 与强化学习框架,用于对话策略学习,能够生成灵活的、词级别的对话动作,无需预定义模板。通过利用文本到文本的 Transformer 实现动态动作生成,并采用奖励塑形的 PPO 进行微调,JoTR 在 MultiWOZ 上实现了最先进性能,成功率达 28% 的提升,并在模拟器和人类评估中均优于强基线模型。
Dialogue policy learning (DPL) is a crucial component of dialogue modelling. Its primary role is to determine the appropriate abstract response, commonly referred to as the "dialogue action". Traditional DPL methodologies have treated this as a sequential decision problem, using pre-defined action candidates extracted from a corpus. However, these incomplete candidates can significantly limit the diversity of responses and pose challenges when dealing with edge cases, which are scenarios that occur only at extreme operating parameters. To address these limitations, we introduce a novel framework, JoTR. This framework is unique as it leverages a text-to-text Transformer-based model to generate flexible dialogue actions. Unlike traditional methods, JoTR formulates a word-level policy that allows for a more dynamic and adaptable dialogue action generation, without the need for any action templates. This setting enhances the diversity of responses and improves the system's ability to handle edge cases effectively. In addition, JoTR employs reinforcement learning with a reward-shaping mechanism to efficiently finetune the word-level dialogue policy, which allows the model to learn from its interactions, improving its performance over time. We conducted an extensive evaluation of JoTR to assess its effectiveness. Our extensive evaluation shows that JoTR achieves state-of-the-art performance on two benchmark dialogue modelling tasks, as assessed by both user simulators and human evaluators.
研究动机与目标
- 为解决传统对话策略学习的局限性,即依赖不完整且预定义的动作候选,从而限制响应多样性与泛化能力。
- 通过将对话策略学习建模为使用文本到文本 Transformer 的条件序列生成问题,实现更灵活、更自然的对话响应。
- 通过带奖励塑形的强化学习提升策略学习的效率与效果,使模型能够通过交互进行自适应与优化。
- 在罕见槽位组合出现的域外或边缘情况中提升鲁棒性。
- 通过自动化模拟与人类评估,在多领域对话基准上展示卓越性能。
提出的方法
- JoTR 使用文本到文本的 Transformer 模型直接在词级别生成对话动作,消除了对固定动作模板或预定义动作集的依赖。
- 该框架将对话策略学习建模为条件序列生成任务,模型根据对话历史与状态预测动作。
- 采用近端策略优化(PPO)的强化学习方法对策略进行微调,通过塑形后的奖励信号优化对话成功度。
- 应用奖励塑形以激励生成信息丰富且高效的响应,例如主动提供额外相关资讯。
- 为 Schema-Guided Dialogue(SGD)数据集实现了一个基于规则的模拟器,以实现对策略性能的可控评估。
- 模型从零开始训练,以避免因预训练在自然语言与对话动作空间之间的分布偏移。

实验结果
研究问题
- RQ1文本到文本的 Transformer 是否能在不依赖预定义动作模板的情况下,生成多样化且有效的对话动作?
- RQ2与仅使用监督微调相比,联合使用强化学习与奖励塑形在多轮对话策略性能上有多大的提升?
- RQ3在多领域对话场景中,词级别策略在罕见或未见槽位组合上的泛化能力如何?
- RQ4在模拟与人类评估中,所提出的框架是否相比强基线模型实现了更高的成功率与更高效的对话流程?
- RQ5当输入空间与自然语言存在显著差异时,预训练在通用语言数据上的模型对策略学习有何影响?
主要发现
- JoTR 在 MultiWOZ 上的成功率为 0.92,在 SGD 上的人工评估成功率为 0.76,显著优于所有基线模型,包括 ChatGPT 与 JoTR${}_{\text{w/o rs}}$。
- 与强基线相比,JoTR 在 MultiWOZ 上的成功率最高提升 28%,证明了联合训练框架的有效性。
- JoTR${}_{\text{pretrained}}$ 在 MultiWOZ 上的表现显著较差(成功率为 0.68),而从零开始训练的 JoTR 成功率达 0.92,表明在通用语言数据上预训练会因分布偏移而产生负面影响。
- 在涉及未见槽位组合的边缘情况(例如同时请求三个槽位)中,JoTR 能够成功告知所有请求的槽位,而 MLP${}_{\text{ppo}}$ 与 JOIE 因动作空间僵化而失败。
- 奖励塑形使 JoTR 能够主动提供额外信息(例如在未明确请求时提供电话号码),而其他模型无法做到,从而提升了对话效率与用户满意度。
- 与基线模型相比,JoTR 生成的对话更短、更高效,尤其在复杂或罕见请求场景中,能在更少轮次内达成用户目标。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。