QUICK REVIEW
[论文解读] f-VAEs: Improve VAEs with Conditional Flows
Jianlin Su, Guang Wu|arXiv (Cornell University)|Sep 16, 2018
Advanced Vision and Imaging被引用 16
一句话总结
本文提出 f-VAEs,一种新颖的生成模型,通过将归一化流整合到变分自编码器中,以提升图像生成质量。通过用基于条件流的后验分布替代高斯后验分布,f-VAEs 在保持显著高于流模型(如 Glow)效率的同时,实现了比标准 VAE 更清晰、更少模糊的生成样本,且收敛速度更快,模型规模更小,性能水平相当。
ABSTRACT
In this paper, we integrate VAEs and flow-based generative models successfully and get f-VAEs. Compared with VAEs, f-VAEs generate more vivid images, solved the blurred-image problem of VAEs. Compared with flow-based models such as Glow, f-VAE is more lightweight and converges faster, achieving the same performance under smaller-size architecture.
研究动机与目标
- 为解决标准 VAE 中因使用简单高斯后验分布而固有的图像模糊问题。
- 降低类似 Glow 的流模型在计算和架构上的负担,这些模型需要深层耦合层堆叠和大量训练时间。
- 将 VAE 与流模型统一为一个通用框架,同时保留两者的优势。
- 通过基于条件归一化流的轻量级、可训练后验分布,实现高效且高质量的图像生成。
提出的方法
- 该模型将标准 VAE 后验 $p(z|x)$ 替换为基于条件流的后验 $p(z|x) = \int \delta(z - F_x(u)) q(u) du$,其中 $F_x(u)$ 是输入 $x$ 条件化的流。
- 条件流 $F_x(u)$ 通过可逆耦合层实现,支持精确似然计算和高效的后验近似。
- 损失函数被推导为 KL 散度 $KL(\tilde{p}(x)p(z|x) \| q(z)q(x|z))$ 的上界,通过引入流的雅可比行列式对数项实现精确似然优化。
- 编码器 $E(x)$ 是一个带有挤压操作的深度卷积网络,而流 $F$ 是一种多尺度、深度减少的架构,受 Glow 启发但使用更小的卷积核。
- 解码器 $G(z)$ 是编码器的逆过程,最终使用 $\tanh$ 激活函数生成逼真的图像样本。
- 该框架在 $F_x(u)$ 退化为线性变换时退化为标准 VAE,在 $F_x(u)$ 与 $x$ 无关时退化为无条件流模型,从而在统一目标下统一了两种模型。
实验结果
研究问题
- RQ1能否有效将归一化流整合到 VAE 中,在保持计算效率的同时提升图像质量?
- RQ2基于条件流的后验是否能显著减少标准 VAE 中观察到的模糊现象?
- RQ3能否在层数更少、模型规模更小的情况下构建出与 Glow 性能相当或更优的流后验?
- RQ4是否存在一个通用、可微分的框架,能将 VAE 与流模型统一于单一训练目标之下?
主要发现
- f-VAEs 有效消除了 VAE 生成图像中的模糊问题,相比标准 VAE,生成的样本更清晰、更逼真。
- 在 64x64 CelebA-HQ 数据集上,f-VAEs 在样本质量和训练速度上均优于 Glow,仅用单张 GTX 1060 显卡训练 7 小时即取得更优结果。
- 在 128x128 CelebA-HQ 上,f-VAEs 以小于 Glow 的模型架构实现了最先进性能,展现出更优的参数效率。
- f-VAEs 潜在空间中的线性插值显示出在真实图像间平滑且有意义的过渡,表明潜在表示具有良好的结构和解耦性。
- 该框架将标准 VAE 和无条件流模型作为特例包含在内,验证了其理论通用性与统一能力。
- 消融实验表明,编码器中使用 3x3 卷积可能限制感知聚焦,提示未来工作应探索更结构化的架构,如 Network-in-Network 或渐进式生长方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。