Skip to main content
QUICK REVIEW

[论文解读] Direct Optimization through $\arg \max$ for Discrete Variational Auto-Encoder

Guy Lorberbom, Andreea Gane|arXiv (Cornell University)|Jun 7, 2018
Generative Adversarial Networks and Image Synthesis参考文献 47被引用 6
一句话总结

该论文提出通过直接损失最小化方法对具有不可微 $\ceil\max$ 操作的离散变分自编码器(VAEs)进行直接优化,避免了Gumbel-Softmax松弛带来的偏差。通过利用两个最大化操作之间的差值进行梯度估计,该方法在无结构和有结构的离散VAEs中均实现了最先进性能,即使在高维结构化空间中也能实现高效训练。

ABSTRACT

Reparameterization of variational auto-encoders with continuous random variables is an effective method for reducing the variance of their gradient estimates. In the discrete case, one can perform reparametrization using the Gumbel-Max trick, but the resulting objective relies on an $\arg \max$ operation and is non-differentiable. In contrast to previous works which resort to softmax-based relaxations, we propose to optimize it directly by applying the direct loss minimization approach. Our proposal extends naturally to structured discrete latent variable models when evaluating the $\arg \max$ operation is tractable. We demonstrate empirically the effectiveness of the direct loss minimization technique in variational autoencoders with both unstructured and structured discrete latent variables.

研究动机与目标

  • 解决在不可微的 $\rceil\max$ 操作中训练离散VAEs时梯度估计方差过高的挑战。
  • 在保持训练效率的同时,消除Gumbel-Softmax松弛在离散VAEs中引入的偏差。
  • 将重参数化技术扩展至求和型松弛不可行的结构化离散潜在空间。
  • 在无监督和半监督设置下,证明直接优化在离散VAEs中的有效性。
  • 为 $\rceil\max$ 操作提供一个理论基础坚实、无需正则性假设的直接损失最小化估计器的证明。

提出的方法

  • 应用Gumbel-Max技巧对离散VAE目标进行重参数化,得到不可微的 $\rceil\max$ 操作。
  • 采用直接损失最小化方法,通过原始目标与扰动目标之间最大化操作的差值来估计 $\rceil\max$ 函数的梯度。
  • 用直接优化替代标准的Gumbel-Softmax松弛,避免了Softmax归一化及其计算开销。
  • 通过在分配上进行可计算的最大化,将该方法扩展至结构化离散潜在空间,即使求和不可行也能处理。
  • 将梯度估计器集成到具有共享编码器架构的VAE框架中,以支持混合连续-离散潜在空间。
  • 在半监督设置中,使用损失函数校准 $\rceil\max$ 预测,以控制生成图像中的离散语义。

实验结果

研究问题

  • RQ1通过最大化操作差值实现的直接优化,能否为具有 $\rceil\max$ 操作的离散VAEs提供低方差、低偏差的梯度估计?
  • RQ2在无结构离散VAEs中,直接优化是否在训练稳定性和生成质量方面优于Gumbel-Softmax松弛?
  • RQ3该直接优化方法能否扩展至Softmax归一化计算上不可行的结构化离散潜在变量模型?
  • RQ4在半监督设置下,直接优化在学习图像生成中解耦离散语义方面的有效性如何?
  • RQ5扰动参数 $\epsilon$ 对直接优化方法的收敛性和性能有何影响?

主要发现

  • 在使用1200个标注样本的MNIST数据集上,直接优化方法在半监督学习中达到96.8%的准确率,优于Gumbel-Softmax的92.7%。
  • 在使用1200个标注样本的Fashion-MNIST数据集上,直接优化达到73.7%的准确率,而Gumbel-Softmax为73.2%,表现出一致的优越性。
  • 在MNIST上的测试边界达到130.921,略优于Gumbel-Softmax的130.063,表明似然估计能力有所提升。
  • 在基于最大流推理的结构化VAEs中,直接优化在性能上与CPLEX推理相当,但速度显著更快,从第85个训练轮次起成为更优选择。
  • 通过弱监督的半监督训练,模型能够通过操纵离散潜在码生成具有可控属性(如眼镜、微笑、性别)的图像。
  • 该方法通过依赖最大化而非求和,实现在高维结构化空间中的高效训练,使其在Gumbel-Softmax失效的场景下仍具可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。