[论文解读] PLATO: Pre-trained Dialogue Generation Model with Discrete Latent Variable
本文提出 PLATO,一种使用离散潜在变量建模对话中一对多响应映射问题的预训练对话生成模型。通过在 Reddit 和 Twitter 数据上联合训练响应生成与潜在行为识别,并采用灵活的注意力机制,PLATO 在开放域对话生成任务中实现了 SOTA 性能,且困惑度低于基线模型,涵盖闲聊、知识增强对话和问答对话任务。
Pre-training models have been proved effective for a wide range of natural language processing tasks. Inspired by this, we propose a novel dialogue generation pre-training framework to support various kinds of conversations, including chit-chat, knowledge grounded dialogues, and conversational question answering. In this framework, we adopt flexible attention mechanisms to fully leverage the bi-directional context and the uni-directional characteristic of language generation. We also introduce discrete latent variables to tackle the inherent one-to-many mapping problem in response generation. Two reciprocal tasks of response generation and latent act recognition are designed and carried out simultaneously within a shared network. Comprehensive experiments on three publicly available datasets verify the effectiveness and superiority of the proposed framework.
研究动机与目标
- 为解决对话生成中的一个对多映射问题,即单个上下文可能对应多个有效响应。
- 通过在大规模 Reddit 和 Twitter 对话数据上预训练,减少通用文本与对话数据之间的分布差异。
- 通过灵活的注意力机制统一双向上下文理解与自回归响应生成。
- 在无监督方式下学习解耦且可解释的对话意图(潜在话语行为),无需人工标注标签。
- 在共享网络中联合优化响应生成与潜在行为识别,以提升生成质量。
提出的方法
- 引入离散潜在变量 z ∈ [1, K] 以表示响应的潜在对话意图(潜在话语行为)。
- 采用统一的基于 Transformer 的架构,并使用灵活的自注意力掩码,以同时支持双向上下文编码与自回归生成。
- 联合预训练两个互惠任务:(1) 响应生成 p(r|c, z) 和 (2) 潜在行为识别 p(z|c, r),在共享网络中进行。
- 在使用通用语言模型(如 BERT 或 GPT)初始化后,于大规模 Reddit 和 Twitter 数据集上预训练该模型。
- 采用对比学习目标,将潜在表征与上下文及响应对齐,以增强解耦性与相关性。
- 利用生成与识别任务之间的相互监督,提升生成响应的质量与多样性。
实验结果
研究问题
- RQ1带有离散潜在变量的预训练对话模型是否能提升开放域对话生成中的响应多样性与流畅性?
- RQ2与单独训练相比,联合学习响应生成与潜在行为识别在多大程度上提升了模型性能?
- RQ3在 Reddit 和 Twitter 数据上进行预训练在多大程度上减少了通用文本与对话数据之间的分布偏移?
- RQ4支持双向与单向处理的灵活注意力机制是否能提升对话任务的性能?
- RQ5无监督学习潜在话语行为是否能达到使用显式控制信号(如情感或领域标签)的方法的性能水平?
主要发现
- PLATO 在三项不同对话任务上均达到 SOTA 表现:闲聊、知识增强对话和对话问答。
- 使用离散潜在变量的模型(如模型 3.1)显著优于无此设计的模型,证明了潜在变量建模的有效性。
- 使用 Reddit 和 Twitter 数据进行进一步预训练,缩小了通用语言模型与对话专用任务之间的性能差距。
- 灵活注意力机制(如模型 1.3)在性能上优于固定单向或双向设置,证实其在捕捉上下文信息方面的优势。
- 联合训练响应生成与潜在行为识别,相比单独训练任一任务,能获得更低的困惑度与更优的响应质量。
- 消融实验表明,潜在变量学习对于建模多样且上下文相关的响应至关重要,且无需依赖显式标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。