Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Contextual Paraphrase Generation using Lexical Control and Reinforcement Learning

Sonal Garg, Sumanth Prabhu|arXiv (Cornell University)|Mar 23, 2021
Topic Modeling参考文献 38被引用 10
一句话总结

本文提出了一种无监督框架,用于在客户支持聊天中生成代理回复的上下文相关改写,结合词汇控制与强化学习(RL)。通过结合对话上下文和原始回复中的控制词,模型生成多样、流畅且语义相似的改写,利用复合指标(语义相似度、文本蕴涵、表达多样性、流畅度)进行强化学习微调,性能最佳(F1得分为0.753)。

ABSTRACT

Customer support via chat requires agents to resolve customer queries with minimum wait time and maximum customer satisfaction. Given that the agents as well as the customers can have varying levels of literacy, the overall quality of responses provided by the agents tend to be poor if they are not predefined. But using only static responses can lead to customer detraction as the customers tend to feel that they are no longer interacting with a human. Hence, it is vital to have variations of the static responses to reduce monotonicity of the responses. However, maintaining a list of such variations can be expensive. Given the conversation context and the agent response, we propose an unsupervised frame-work to generate contextual paraphrases using autoregressive models. We also propose an automated metric based on Semantic Similarity, Textual Entailment, Expression Diversity and Fluency to evaluate the quality of contextual paraphrases and demonstrate performance improvement with Reinforcement Learning (RL) fine-tuning using the automated metric as the reward function.

研究动机与目标

  • 为解决尽管响应质量高但单调、模板化的客户支持聊天回复所导致的用户体验下降问题。
  • 在无需标注训练数据的前提下,生成多样、上下文相关且流畅的预设代理回复改写。
  • 开发一种结合语义相似度、文本蕴涵、表达多样性与流畅度的自动化评估指标,用于评估改写质量。
  • 通过使用复合指标作为奖励函数的强化学习微调,进一步提升改写质量。
  • 实现无监督、上下文感知的改写生成,保持意图不变的同时提升回复的自然度与表现力。

提出的方法

  • 使用经过无监督微调的自回归语言模型(GPT-2)进行初始改写生成。
  • 通过注入原始代理回复中的关键词作为控制信号,实施词汇控制以保持语义内容。
  • 在生成过程中整合对话上下文,以确保上下文相关性与连贯性。
  • 采用复合自动化评估指标:使用BERTScore衡量语义相似度,使用自定义模型衡量文本蕴涵,使用基于BLEU的指标衡量表达多样性,使用自定义模型衡量流畅度。
  • 使用复合指标作为奖励信号,训练强化学习策略以优化改写质量。
  • 在训练过程中采用基于采样的控制词注入方法,以在保持语义保真度的同时提升表达多样性。

实验结果

研究问题

  • RQ1仅使用上下文与词汇控制,能否有效应用于客户支持聊天回复的无监督改写生成?
  • RQ2结合上下文与控制词对生成改写的流畅度、多样性与语义相似度有何影响?
  • RQ3结合语义相似度、文本蕴涵、表达多样性与流畅度的复合自动化指标,能否有效作为人类评估的代理?
  • RQ4使用复合指标作为奖励函数的强化学习微调,是否能显著提升改写质量,优于基线无监督方法?
  • RQ5在控制词中引入噪声或采样控制词,如何影响生成改写中多样性与相关性之间的权衡?

主要发现

  • 基于强化学习的微调方法取得了最高的综合得分0.753,显著优于第二好的方法(仅上下文,M=0.744,p=9.3e-8)。
  • 仅上下文基线方法虽表达多样性高,但语义相似度与文本蕴涵得分较低,表明多样性与内容保真度之间存在权衡。
  • 仅控制词方法语义相似度高,但表达多样性低,归因于词汇偏差,证实了平衡控制的必要性。
  • 在控制词中加入随机噪声可提升多样性,但损害了流畅度与相关性,表明未经控制的扰动存在风险。
  • 在训练过程中采用控制词采样方法,在保持高语义相似度与流畅度的同时提升了表达多样性,优于噪声注入方法。
  • 人工评估确认了自动化指标得分与人工标注高度一致,验证了复合指标的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。