[论文解读] Towards Generating Long and Coherent Text with Multi-Level Latent Variable Models
本文提出了一种多层级变分自编码器(ml-VAE),通过分层的随机层和多层级解码器,建模高层语义规划与低层词级细节,从而生成长篇且连贯的文本。该模型缓解了后验坍缩问题,生成的文本在多样性与语义一致性方面优于标准VAE。
Variational autoencoders (VAEs) have received much attention recently as an end-to-end architecture for text generation with latent variables. In this paper, we investigate several multi-level structures to learn a VAE model to generate long, and coherent text. In particular, we use a hierarchy of stochastic layers between the encoder and decoder networks to generate more informative latent codes. We also investigate a multi-level decoder structure to learn a coherent long-term structure by generating intermediate sentence representations as high-level plan vectors. Empirical results demonstrate that a multi-level VAE model produces more coherent and less repetitive long text compared to the standard VAE models and can further mitigate the posterior-collapse issue.
研究动机与目标
- 为解决使用变分自编码器生成长篇连贯文本的挑战,这类模型通常在长度和连贯性方面表现不佳。
- 缓解文本VAE中常见的后验坍缩问题,即模型忽略潜在码的情况。
- 通过引入分层潜在结构,改善长期依赖建模,以捕捉句子级规划与词级细节。
- 在潜在空间中实现平滑连续插值,以实现有意义的语义过渡。
- 通过学习到的解耦表示,支持内容保持的属性操作。
提出的方法
- 采用分层的随机潜在变量,其中每一层潜在变量的先验分布均以高层表示为条件,从而实现更丰富且基于数据的先验分布。
- 使用具有自顶向下结构的多层级解码器:首先由一个句子级RNN生成规划向量,再以此条件控制一个词级RNN进行自回归生成。
- 引入分层编码器-解码器架构,使模型可在生成词语前进行句子级规划,从而提升长距离连贯性。
- 利用分层推理网络学习更具信息量且解耦的潜在码,以减少后验坍缩。
- 采用重参数化梯度的变分推断方法,并在底层使用高斯混合先验,以增强表示灵活性。
- 通过减去负面情感和正面情感评论的平均潜在码,生成情感方向向量,实现属性向量运算。
实验结果
研究问题
- RQ1具有多层级潜在变量的分层VAE架构是否能生成比标准VAE更长、更连贯的文本?
- RQ2所提出的模型在缓解文本生成中的后验坍缩问题方面效果如何?
- RQ3学习到的潜在空间是否能支持语义上截然不同的文本样本之间的平滑、有意义的插值?
- RQ4属性向量运算在多大程度上能实现情感转移,同时保持长篇文本的内容?
- RQ5多层级解码器是否能提升语义连贯性并减少生成长篇文本中的重复现象?
主要发现
- 与标准VAE基线相比,ml-VAE在Yelp评论数据集上的定性样本显示,其生成的长篇文本具有显著更高的连贯性与更低的重复性。
- 模型实现了更平滑的潜在空间插值,线性轨迹上两个潜在码之间的中间点生成的句子语义连贯且语法正确。
- 通过简单的属性向量运算,模型成功将情感从负面转移到正面,其中83.4%的修改后评论被预训练的情感分类器判定为正面。
- 模型表现出更少的后验坍缩,表现为潜在码在生成多样化且语境恰当的文本中得到了有效利用。
- 潜在空间中的线性插值显示出从正面到负面情感的渐进过渡,表明情感因素实现了平滑且有意义的解耦。
- 在语言建模任务中,模型的困惑度更低,并在无条件与条件生成设置下均生成了更高质量的样本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。