[论文解读] Implicit Deep Latent Variable Models for Text Generation
本文提出隐式深度潜在变量模型(iVAE 和 iVAE-MI),用基于样本的表示替代高斯变分后验,以增强表征能力并缓解文本生成中的后验崩溃问题。通过最大化互信息将聚合后验匹配到先验,并使用共轭对偶KL散度,该模型在语言建模、风格迁移和对话回复生成任务中均达到最先进性能。
Deep latent variable models (LVM) such as variational auto-encoder (VAE) have recently played an important role in text generation. One key factor is the exploitation of smooth latent structures to guide the generation. However, the representation power of VAEs is limited due to two reasons: (1) the Gaussian assumption is often made on the variational posteriors; and meanwhile (2) a notorious "posterior collapse" issue occurs. In this paper, we advocate sample-based representations of variational distributions for natural language, leading to implicit latent features, which can provide flexible representation power compared with Gaussian-based posteriors. We further develop an LVM to directly match the aggregated posterior to the prior. It can be viewed as a natural extension of VAEs with a regularization of maximizing mutual information, mitigating the "posterior collapse" issue. We demonstrate the effectiveness and versatility of our models in various text generation scenarios, including language modeling, unaligned style transfer, and dialog response generation. The source code to reproduce our experimental results is available on GitHub.
研究动机与目标
- 解决变分自编码器(VAEs)在文本生成中的局限性,特别是变分后验的高斯假设限制。
- 缓解VAE中的后验崩溃问题,即解码器因后验近似不佳而忽略潜在码。
- 通过使用隐式、基于样本的分布而非参数化的高斯族,构建灵活的潜在表征框架。
- 通过鼓励潜在特征协作并捕捉有意义的句子级信息,提升生成质量和多样性。
- 提出一种新的训练目标,通过最大化潜在码与数据之间的互信息,增强表征学习。
提出的方法
- 在潜在空间中用隐式、基于样本的表示替代标准的高斯变分后验,以提升建模灵活性。
- 提出iVAE-MI模型,通过双形式KL散度直接将所有数据的聚合后验匹配到先验分布。
- 使用KL散度的共轭对偶形式,实现在无需显式密度评估的情况下进行训练,通过辅助对偶函数实现优化。
- 通过学习从上下文嵌入到先验样本的映射,在对话生成中引入上下文感知先验和条件建模。
- 使用可微分目标函数进行训练,通过互信息最大化,促使潜在码既具有信息量又具备多样性。
- 采用GRU架构作为编码器、解码器和上下文编码器,支持对话和文本生成任务中的序列建模。
实验结果
研究问题
- RQ1与固定高斯分布相比,基于样本的潜在表示能否提升文本生成中变分后验的表达能力?
- RQ2隐式潜在变量模型在自回归VAE中能在多大程度上缓解后验崩溃问题?
- RQ3通过互信息最大化将聚合后验匹配到先验,是否能带来更解耦且有意义的潜在表征?
- RQ4隐式LVM在语言建模、风格迁移和对话回复生成等多样化文本生成任务中表现如何?
- RQ5所提方法能否在保持训练稳定性和生成多样性的同时实现最先进性能?
主要发现
- iVAE-MI模型在所有评估任务中均持续优于基线VAE及CVAE、SeqGAN等强基线模型。
- 在对话回复生成任务中,iVAE-MI显著提升了BOW嵌入得分和Distinct-1/2指标,表明语义相关性与多样性更优。
- 在Switchboard和DailyDialog数据集上,iVAE-MI获得更高的BLEU-4分数和更好的召回率,表明与参考回复的n-gram重叠度更高。
- 在风格迁移任务中,该模型更好地保留了内容,生成的句子比ARAE更有效地保持了源句语义。
- 共轭对偶KL形式使无需显式密度评估即可有效训练,使隐式后验在实践中可训练。
- 实验结果表明,隐式表示可生成更具多样性与语义意义的潜在码,有效缓解后验崩溃。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。