Skip to main content
QUICK REVIEW

[论文解读] Generative networks as inverse problems with Scattering transforms

Tomás Angles, Stéphane Mallat|arXiv (Cornell University)|May 17, 2018
Generative Adversarial Networks and Image Synthesis参考文献 13被引用 7
一句话总结

本文提出了一种新颖的生成建模框架,通过反转预定义的小波散射变换嵌入,将深度卷积生成网络表述为逆问题,从而无需对抗性训练或学习到的编码器。该方法通过利普希茨连续、尺度分离的信号表示,实现了类似 GAN 的图像生成质量和形变特性,定量结果表明在 CelebA、Polygon5 和 LSUN 数据集上均表现出具有竞争力的重建与生成性能。

ABSTRACT

Generative Adversarial Nets (GANs) and Variational Auto-Encoders (VAEs) provide impressive image generations from Gaussian white noise, but the underlying mathematics are not well understood. We compute deep convolutional network generators by inverting a fixed embedding operator. Therefore, they do not require to be optimized with a discriminator or an encoder. The embedding is Lipschitz continuous to deformations so that generators transform linear interpolations between input white noise vectors into deformations between output images. This embedding is computed with a wavelet Scattering transform. Numerical experiments demonstrate that the resulting Scattering generators have similar properties as GANs or VAEs, without learning a discriminative network or an encoder.

研究动机与目标

  • 为了解决尽管存在基于距离的训练中维度灾难,但 GAN 和 VAE 一般化能力缺乏数学理解的问题。
  • 通过预定义一个稳定的嵌入算子,消除生成建模中对抗性训练或学习编码器的需求。
  • 证明生成网络可以在不训练判别器或编码器的情况下,实现类似 GAN 的图像质量和形变特性。
  • 提供一个基于小波散射变换的数学基础坚实的逆问题框架,用于生成建模。

提出的方法

  • 生成器被训练为固定且预定义的嵌入算子的逆,具体为小波散射变换,其具有对形变的利普希茨连续性。
  • 使用小波散射变换计算嵌入算子,该变换通过小波系数的局部 l¹ 范数实现平移的线性化和高斯化。
  • 生成器实现为与 DCGAN 相同架构的深度卷积网络,通过正则化反演过程以防止过拟合。
  • 通过最小化重建图像与原始训练图像之间的 L¹ 损失来执行反演,将散射系数用作潜在码。
  • 该方法利用小波系数的稀疏性以及网络激活的稀疏性(70% 为零)作为隐式正则化。
  • 该方法避免超参数调优,依赖于散射变换的内在特性,以实现稳定且可泛化的图像生成。

实验结果

研究问题

  • RQ1是否可以通过反转固定嵌入算子,在不使用对抗性训练或学习编码器的情况下实现生成图像合成?
  • RQ2何种嵌入算子特性是重现 GAN 中观察到的形变与形变行为所必需的?
  • RQ3与学习编码器相比,使用散射变换作为嵌入算子在重建和泛化性能方面表现如何?
  • RQ4小波系数和网络激活的稀疏性在多大程度上促进了生成器的泛化能力?
  • RQ5生成建模的逆问题表述是否能为隐式生成模型提供一种更具可解释性和数学基础的替代方案?

主要发现

  • 在 CelebA 测试集上,散射生成器的 PSNR 重建误差为 21.17 dB,在 Polygon5 上为 34.44 dB,在 LSUN(卧室)上为 18.53 dB,表明重建保真度较强。
  • 在散射潜在空间中进行线性插值可在训练图像与测试图像之间产生平滑、连续的图像形变,复现了类似 GAN 的形变行为。
  • 对于 Polygon5 和 CelebA 等更简单的数据集,生成器可生成高质量、清晰的图像;而 LSUN 图像因内存容量有限,缺失了高频细节。
  • 网络平均激活稀疏度为 70%,表明稀疏性是所学习生成器中关键的正则化机制。
  • 将训练数据减少至 256 个样本后,重建中恢复了高频细节,证实图像质量下降是由于内存限制而非架构缺陷。
  • 该方法对随机高斯噪声输入具有良好的泛化能力,生成的图像与训练数据在视觉上高度相似,尤其在更简单的数据集上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。