Skip to main content
QUICK REVIEW

[论文解读] Preventing Posterior Collapse with Levenshtein Variational Autoencoder

Serhii Havrylov, Ivan Titov|arXiv (Cornell University)|Apr 30, 2020
Topic Modeling参考文献 41被引用 5
一句话总结

本文提出了莱文施泰因变分自编码器(Lev-VAE),一种新颖的变分自编码器目标函数,通过优化基于莱文施泰因距离的核密度估计器与模型分布之间KL散度的上界,防止后验崩溃。通过在每一步都利用莱文施泰因距离鼓励生成器预测最优的序列延续,该模型在不改变网络架构的情况下学习到解耦且信息丰富的潜在表征,在情感分析和自然语言蕴涵等下游任务上优于β-VAE和循环退火VAE。

ABSTRACT

Variational autoencoders (VAEs) are a standard framework for inducing latent variable models that have been shown effective in learning text representations as well as in text generation. The key challenge with using VAEs is the {\it posterior collapse} problem: learning tends to converge to trivial solutions where the generators ignore latent variables. In our Levenstein VAE, we propose to replace the evidence lower bound (ELBO) with a new objective which is simple to optimize and prevents posterior collapse. Intuitively, it corresponds to generating a sequence from the autoencoder and encouraging the model to predict an optimal continuation according to the Levenshtein distance (LD) with the reference sentence at each time step in the generated sequence. We motivate the method from the probabilistic perspective by showing that it is closely related to optimizing a bound on the intractable Kullback-Leibler divergence of an LD-based kernel density estimator from the model distribution. With this objective, any generator disregarding latent variables will incur large penalties and hence posterior collapse does not happen. We relate our approach to policy distillation \cite{RossGB11} and dynamic oracles \cite{GoldbergN12}. By considering Yelp and SNLI benchmarks, we show that Levenstein VAE produces more informative latent representations than alternative approaches to preventing posterior collapse.

研究动机与目标

  • 为解决变分自编码器中的后验崩溃问题,即生成器在生成过程中忽略潜在变量的问题。
  • 开发一种简单、高效且通用的训练目标,无需修改模型架构即可防止后验崩溃。
  • 证明所提出的方法相较于β-VAE和循环退火VAE等现有方法,能生成更具信息量的潜在表征。
  • 展示该方法在不同任务上的泛化能力,包括表征学习和语言建模。
  • 提供一个基于莱文施泰因距离核密度估计器与模型分布之间KL散度上界的概率基础目标函数。

提出的方法

  • 用一种新损失函数替代标准ELBO目标,以鼓励生成器在每个时间步预测生成序列的最优延续。
  • 使用当前生成前缀与真实目标序列之间的莱文施泰因距离定义最优延续。
  • 使用动态规划高效计算每一步的最优延续集合,从而实现可微训练。
  • 将目标函数表述为不可计算的KL散度上界,该KL散度衡量基于莱文施泰因距离的核密度估计器与模型分布之间的差异。
  • 通过结合基于最优延续预测的重建损失和先验与后验分布之间的KL正则化项来训练模型。
  • 将该方法应用于非条件生成和下游分类任务,使用线性探测器分析潜在表征。

实验结果

研究问题

  • RQ1基于莱文施泰因距离的新VAE目标是否能在不修改架构的前提下防止后验崩溃?
  • RQ2所提出的莱文施泰因VAE在表征质量方面与β-VAE和循环退火VAE相比表现如何?
  • RQ3当模型无法依赖标准真实前缀时,其潜在空间在多大程度上捕捉到了有意义的句子结构?
  • RQ4该方法是否能泛化到下游NLP任务,如自然语言蕴涵和情感分类?
  • RQ5在训练策略下,该模型能否在避免暴露偏差的同时保持强大的生成质量?

主要发现

  • 在SNLI数据集上,当α=1.0时,莱文施泰因VAE的线性探测准确率达到63.80%,优于β-VAE(60.33%)和循环退火VAE(55.54%),且在相似训练条件下表现更优。
  • 简单的非变分莱文施泰因自编码器(Lev. AE)在SNLI上达到61.49%的准确率,超过标准VAE(43.36%),证明了核心思想的有效性,即使没有潜在正则化。
  • 在Yelp情感分析数据集上,Lev-VAE在使用更大KL值的情况下仍优于β-VAE和循环退火VAE,表明其潜在代码更具信息量。
  • 在输入句子的所有位置上,Lev-VAE的词重建准确率均高于β-VAE,表明Lev-VAE更有效地利用潜在代码,而非依赖真实前缀。
  • 在不同标注数据量的半监督设置下,Lev-VAE在所有数据配置下均优于β-VAE,验证了其鲁棒性与泛化能力。
  • 在Yelp数据集上,该模型实现了接近完美的自编码性能(重建损失≈1.49),表明潜在空间完整捕捉了句子信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。