Skip to main content
QUICK REVIEW

[论文解读] Polite Dialogue Generation Without Parallel Data

Tong Niu, Mohit Bansal|arXiv (Cornell University)|May 8, 2018
Topic Modeling参考文献 63被引用 5
一句话总结

本文提出三种弱监督模型——Fusion、Label-Fine-Tuning(LFT)和Polite-RL——通过利用预训练的礼貌分类器,在无需平行数据的情况下生成礼貌或粗鲁的对话回复。LFT和Polite-RL模型在保持对话质量的同时显著提升了礼貌程度,在人类评估中优于Fusion模型和检索基线模型。

ABSTRACT

Stylistic dialogue response generation, with valuable applications in personality-based conversational agents, is a challenging task because the response needs to be fluent, contextually-relevant, as well as paralinguistically accurate. Moreover, parallel datasets for regular-to-stylistic pairs are usually unavailable. We present three weakly-supervised models that can generate diverse polite (or rude) dialogue responses without parallel data. Our late fusion model (Fusion) merges the decoder of an encoder-attention-decoder dialogue model with a language model trained on stand-alone polite utterances. Our label-fine-tuning (LFT) model prepends to each source sequence a politeness-score scaled label (predicted by our state-of-the-art politeness classifier) during training, and at test time is able to generate polite, neutral, and rude responses by simply scaling the label embedding by the corresponding score. Our reinforcement learning model (Polite-RL) encourages politeness generation by assigning rewards proportional to the politeness classifier score of the sampled response. We also present two retrieval-based polite dialogue model baselines. Human evaluation validates that while the Fusion and the retrieval-based models achieve politeness with poorer context-relevance, the LFT and Polite-RL models can produce significantly more polite responses without sacrificing dialogue quality.

研究动机与目标

  • 开发无需平行训练数据即可生成风格上礼貌或粗鲁对话回复的模型。
  • 在开放域对话中转移礼貌风格的同时保持上下文相关性和流畅性。
  • 探索仅使用预训练礼貌分类器和非配对对话数据的弱监督方法。
  • 评估生成模型中礼貌性与对话质量之间的权衡。
  • 实现在连续礼貌谱上的可控回复生成。

提出的方法

  • Fusion模型通过将对话模型的解码器与在独立礼貌话语上训练的语言模型进行晚期融合。
  • Label-Fine-Tuning(LFT)模型在训练期间将经过礼貌分数缩放的标签嵌入拼接至输入序列,从而在推理时通过标签缩放实现控制。
  • Polite-RL模型使用基于分类器连续礼貌分数的奖励信号,通过策略梯度强化学习优化回复生成。
  • 所有模型均基于序列到序列对话模型和先进的礼貌分类器构建,支持与新架构的模块化集成。
  • 采用两种检索基线进行比较:一种从分类器选出的礼貌回复中检索,另一种从人工精选的礼貌话语中检索。
  • 使用显著性可视化分析Polite-RL模型中哪些标记对礼貌分类器的奖励贡献最大。

实验结果

研究问题

  • RQ1我们能否在无平行数据的情况下生成多样且上下文相关的礼貌对话回复?
  • RQ2仅使用风格分类器,如何控制生成回复的礼貌程度?
  • RQ3以礼貌性为优先的模型是否会牺牲对话质量和连贯性?
  • RQ4生成式方法与检索基线相比,哪种方法在礼貌性和上下文相关性之间达到更好平衡?
  • RQ5基于分类器奖励的强化学习能否有效引导风格化回复生成?

主要发现

  • LFT和Polite-RL模型生成的回复显著更礼貌,且未牺牲对话质量,优于基础Seq2seq模型。
  • 人类评估显示,LFT和Polite-RL模型保持了高水平的对话连贯性和相关性,而Fusion模型和检索基线则表现不佳。
  • Fusion模型和检索基线模型虽提升了礼貌程度,但以牺牲上下文相关性和流畅性为代价。
  • LFT模型通过推理时缩放标签嵌入,实现了对礼貌程度的细粒度控制。
  • 显著性可视化证实,Polite-RL模型学会了关注关键礼貌标记,如“sorry”、“sir”和“smart”。
  • 这些模型成功学习并应用了多种礼貌策略,包括间接表达、积极词汇和敬语,符合心理语言学文献中的定义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。