[论文解读] Conditional Inference in Pre-trained Variational Autoencoders via Cross-coding
本文提出交叉编码(cross-coding),一种无需微调解码器即可在预训练变分自编码器(VAEs)中实现高效条件推理的方法。通过使用交叉编码器网络近似给定证据下潜在变量的后验分布,该方法实现了对任意查询-证据分解的快速采样,在定量和定性评估中均优于哈密顿蒙特卡洛(HMC),尤其在高维设置下表现更优。
Variational Autoencoders (VAEs) are a popular generative model, but one in which conditional inference can be challenging. If the decomposition into query and evidence variables is fixed, conditional VAEs provide an attractive solution. To support arbitrary queries, one is generally reduced to Markov Chain Monte Carlo sampling methods that can suffer from long mixing times. In this paper, we propose an idea we term cross-coding to approximate the distribution over the latent variables after conditioning on an evidence assignment to some subset of the variables. This allows generating query samples without retraining the full VAE. We experimentally evaluate three variations of cross-coding showing that (i) they can be quickly optimized for different decompositions of evidence and query and (ii) they quantitatively and qualitatively outperform Hamiltonian Monte Carlo.
研究动机与目标
- 解决在需要任意查询-证据分解时,预训练 VAE 中高效条件推理的挑战。
- 克服条件 VAE 的局限性,后者需为每种新分解重新训练。
- 改进 MCMC 方法(如哈密顿蒙特卡洛)在高维潜在空间中混合时间过长的问题。
- 开发一种可复用预训练解码器、避免昂贵微调的变分推理框架。
- 证明交叉编码可在多种数据集和查询类型下实现快速、高质量的采样。
提出的方法
- 引入一个交叉编码器网络 $\mathrm{XCoder}_{\psi}(\bm{\epsilon})$,将噪声 $\bm{\epsilon}$ 映射为给定证据 $\mathbf{x}$ 的条件潜在分布 $q_{\psi}(\mathbf{z}|\mathbf{x})$。
- 通过条件证据下界(C-ELBO)优化交叉编码器,以收紧真实条件似然 $p_{\theta}(\mathbf{y}|\mathbf{x})$ 的界。
- 使用重参数化梯度实现对随机采样过程的高效反向传播。
- 采用三种变体进行比较:高斯变分推理(GVI)、归一化流(NF)和全连接网络(FCN)。
- 利用解码器 $p_{\theta}(\mathbf{t}|\mathbf{z})$,通过从交叉编码器采样 $M$ 个样本,从条件分布 $p_{\theta}(\mathbf{y}|\mathbf{x})$ 生成样本。
- 该方法确保查询分布中的误差受潜在后验误差控制,得益于 KL 散度中的有利抵消效应。
实验结果
研究问题
- RQ1交叉编码是否能在不微调解码器的前提下,实现预训练 VAE 中快速且准确的条件推理?
- RQ2在高维潜在空间中,交叉编码与哈密顿蒙特卡洛在采样质量与混合时间方面相比如何?
- RQ3不同交叉编码器架构(GVI、NF 和 FCN)在不同查询-证据分解下是否表现出显著不同的性能?
- RQ4C-ELBO 是否可作为评估 VAE 中条件采样质量的可靠代理指标?
- RQ5交叉编码是否能在 MNIST、Anime 和 CelebA 等多样化数据集上,针对不同潜在维度保持良好性能?
主要发现
- 在 Anime 数据集上,高斯变分推理(GVI)交叉编码器在 C-ELBO 和查询边缘似然上均优于归一化流(NF)和哈密顿蒙特卡洛(HMC)。
- 在 CelebA 数据集上,GVI 表现与 NF 相当或略逊,但两者在定量和定性指标上均显著优于 HMC。
- HMC 在高维设置(64 和 100 个潜在维度)下表现出混合性能差、覆盖不足,导致样本过度集中且多样性低。
- 在低维 MNIST 实验中,所有交叉编码器变体(GVI、NF、FCN)表现良好,且 GVI 和 NF 在 C-ELBO 和似然指标上均优于 HMC。
- 交叉编码框架实现了对任意查询-证据分解的快速优化,无需微调 VAE 解码器。
- 定性结果表明,GVI 生成了多样且高保真度的样本,与输入证据高度匹配;而 HMC 和 NF 经常陷入单一模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。