QUICK REVIEW
[论文解读] Variational auto-encoders with Student's t-prior
Najmeh Abiri, Mattias Ohlsson|arXiv (Cornell University)|Apr 6, 2020
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结
本文提出一种使用多元 t 分布先验的变分自编码器(VAE),以提升模型的鲁棒性与图像重建质量。通过利用隐式重参数化对 t 分布的参数进行可微训练,该模型在数据受损或存在缺失值的情况下,相比使用高斯先验的标准 VAE,能够实现更清晰、更细节丰富的重建结果,该结论在 Fashion-MNIST 数据集上通过更高的 SSIM 分数得到验证。
ABSTRACT
We propose a new structure for the variational auto-encoders (VAEs) prior, with the weakly informative multivariate Student's t-distribution. In the proposed model all distribution parameters are trained, thereby allowing for a more robust approximation of the underlying data distribution. We used Fashion-MNIST data in two experiments to compare the proposed VAEs with the standard Gaussian priors. Both experiments showed a better reconstruction of the images with VAEs using Student's t-prior distribution.
研究动机与目标
- 通过用多元学生 t 分布替换标准高斯先验,提升变分自编码器的鲁棒性与生成质量。
- 通过隐式重参数化对位置、尺度和自由度参数进行反向传播,实现学生 t 先验的端到端训练。
- 在图像重建与缺失数据填补任务上评估模型性能,尤其关注高污染水平下的表现。
- 证明灵活的重尾先验相比高斯先验能实现更好的泛化能力与更清晰的重建结果。
提出的方法
- VAE 使用多元学生 t 分布作为潜在变量的先验,其参数(位置 μ、尺度 σ、自由度 ν)由编码器网络预测。
- 通过尺度混合表示对 t 分布进行重参数化:z = μ + σ * x / sqrt(χ²/ν),其中 x ~ N(0, I),χ² ~ Gamma(ν/2, 0.5)。
- 使用伽马分布累积分布函数的隐式微分,实现对自由度参数 ν 的梯度反向传播,从而支持端到端训练。
- 通过 digamma 函数解析计算变分后验与学生 t 先验之间的 KL 散度,并通过数值积分计算对数归一化项。
- 使用随机梯度下降进行训练,重建损失采用交叉熵,正则化项使用推导出的 KL 散度。
- 通过验证集选择超参数,测试数据上的性能通过 SSIM 指数进行评估。
实验结果
研究问题
- RQ1与标准高斯先验相比,学生 t 先验是否能提升 VAE 中的图像重建质量?
- RQ2学生 t 分布的自适应尾部厚度是否能增强 VAE 对异常值和缺失数据的鲁棒性?
- RQ3能否通过隐式重参数化实现可学习学生 t 先验的 VAE 端到端训练?
- RQ4在损坏的 Fashion-MNIST 数据上,使用学生 t 先验的 VAE 与高斯先验 VAE 在 SSIM 指标上的表现如何比较?
主要发现
- 在 Fashion-MNIST 数据集上,当像素损坏比例达 78% 时,使用学生 t 先验的 VAE(VAE-St)的平均 SSIM 达到 0.831,显著优于使用高斯先验的 VAE(VAE-G)的 0.678。
- 视觉评估确认,VAE-St 在高损坏场景下生成的重建图像更清晰、细节更丰富,模糊程度更低,优于 VAE-G。
- 在完整 Fashion-MNIST 数据上,VAE-St 的重建质量也优于 VAE-G,表现为 SSIM 提升与视觉保真度增强。
- 训练学生 t 先验 VAE 的计算开销仅略高于高斯版本,GPU 推理时间差异可忽略。
- 模型能够学习自由度参数,实现自适应的尾部厚度,从而提升对异常值和缺失数据的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。