[论文解读] Generating Multiple Diverse Responses for Short-Text Conversation
该论文提出了一种基于强化学习的生成模型,通过采样可解释的潜在词作为动作,联合建模一个帖子及其多个多样化回复。通过将每个潜在词视为策略网络中的一个决策,该模型能够同时生成高质量且多样化的回复,在微博和推特数据集上的响应质量和多样性方面均优于当前最先进方法。
Neural generative models have become popular and achieved promising performance on short-text conversation tasks. They are generally trained to build a 1-to-1 mapping from the input post to its output response. However, a given post is often associated with multiple replies simultaneously in real applications. Previous research on this task mainly focuses on improving the relevance and informativeness of the top one generated response for each post. Very few works study generating multiple accurate and diverse responses for the same post. In this paper, we propose a novel response generation model, which considers a set of responses jointly and generates multiple diverse responses simultaneously. A reinforcement learning algorithm is designed to solve our model. Experiments on two short-text conversation tasks validate that the multiple responses generated by our model obtain higher quality and larger diversity compared with various state-of-the-art generative models.
研究动机与目标
- 为了解决现有神经生成模型仅对每个输入帖子生成单一回复的局限性,尽管现实世界对话中通常包含多个回复。
- 联合建模一个帖子及其回复集合,捕捉回复间的多样性与上下文相关性。
- 通过使用大规模可解释词汇的潜在空间作为控制信号,实现在一次生成中同时输出多个多样化回复。
- 通过强化学习框架克服在大规模潜在空间中精确梯度计算的计算不可行性。
- 在响应质量与多样性方面超越现有的束搜索和变分自编码器方法。
提出的方法
- 该模型为每个输入帖子引入一个潜在变量分布,其中每个采样值对应词汇表中的一个特定词语,作为回复生成的控制信号。
- 一个潜在词推理网络为给定帖子估计所有词汇表词语的概率分布,从而支持多样化采样。
- 每个采样得到的潜在词被用作生成网络的条件输入,该网络基于帖子和所选词语生成回复。
- 通过强化学习算法优化策略网络,以最大化联合奖励信号,该信号共同评估所有生成回复的质量与多样性。
- 训练采用一种促进多样性的采样方案,即从不同语义簇中选择潜在词,从而提升收敛速度与回复多样性。
- 奖励函数被设计为在响应与输入帖子的相关性与回复之间的多样性之间取得平衡,且不依赖于对完整潜在空间的精确梯度计算。
实验结果
研究问题
- RQ1生成模型能否联合学习为单个输入帖子生成多个多样化回复,而非将回复视为独立输出?
- RQ2如何有效利用大规模可解释词汇的潜在空间来控制回复多样性,同时避免产生禁止性的计算成本?
- RQ3基于词级别动作的强化学习能否在生成短文本对话的高质量、多样化回复方面超越现有方法?
- RQ4所选潜在词在多大程度上与生成回复的内容和语义相关?
- RQ5联合建模多个回复是否能带来优于独立生成或重排序方法的性能提升?
主要发现
- 在推特数据集的人工评估中,所提模型 Ours(Min) 的优质回复比例比 MMI 高 70%,比 MultiMech 高 126%,证明其在响应质量和多样性方面表现更优。
- 在推特数据集上,Ours(Min) 在所有自动评估指标(包括 BLEU 和 distinct-1/2)上均优于所有基线模型,尤其在使用更大潜在空间时表现更佳。
- 当潜在空间缩小时(如仅 1k 个词),模型性能显著下降,证实了大词汇量对于实现有效多样性与高质量生成至关重要。
- 训练过程中奖励值随训练轮次稳步上升,表明强化学习策略成功随时间优化,学习到了更优的潜在词分布。
- 注意力可视化显示,所选潜在词与输入帖子中的关键词高度对齐,证实模型学习到了有意义且上下文感知的控制信号。
- 该方法生成的回复在语义上各不相同且与上下文相关,不同回复聚焦于输入内容的不同方面,而不同于依赖固定机制或束搜索的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。