[论文解读] When and How Can Deep Generative Models be Inverted?
该论文提出了一种基于稀疏表示理论的、理论基础坚实的逐层反演方法,适用于深度生成模型(如 GANs、VAEs),可实现从信号中可证明地恢复潜在向量。该方法引入了 Latent-Pursuit 算法,在重建和图像修复任务中优于梯度下降法,即使在输入受损的情况下也能保持优异性能,且在一般条件下确保唯一解,无需依赖随机权重。
Deep generative models (e.g. GANs and VAEs) have been developed quite extensively in recent years. Lately, there has been an increased interest in the inversion of such a model, i.e. given a (possibly corrupted) signal, we wish to recover the latent vector that generated it. Building upon sparse representation theory, we define conditions that are applicable to any inversion algorithm (gradient descent, deep encoder, etc.), under which such generative models are invertible with a unique solution. Importantly, the proposed analysis is applicable to any trained model, and does not depend on Gaussian i.i.d. weights. Furthermore, we introduce two layer-wise inversion pursuit algorithms for trained generative networks of arbitrary depth, and accompany these with recovery guarantees. Finally, we validate our theoretical results numerically and show that our method outperforms gradient descent when inverting such generators, both for clean and corrupted signals.
研究动机与目标
- 建立深度生成模型在何种一般理论条件下可实现唯一解反演,且不依赖于反演算法。
- 为训练好的全连接生成网络设计一种可证明正确的逐层反演算法,确保在无噪声和有噪声场景下的性能保证。
- 通过实证结果证明,所提方法在干净和受损信号上的重建精度与鲁棒性均优于梯度下降法。
- 提供不依赖于 i.i.d. 高斯权重或生成器平滑性假设的反演理论保证,超越先前工作。
提出的方法
- 该方法将反演问题表述为最小化生成信号与观测信号之间的 L2 距离,即 $\min_{\mathbf{z}} \frac{1}{2}\|G(\mathbf{z}) - \mathbf{y}\|_2^2$。
- 利用稀疏表示理论,将每一隐藏层建模为稀疏向量与权重矩阵相乘后通过 ReLU 激活函数。
- 通过基追踪去噪(BPDN)实现逐层反演以恢复稀疏表示,并引入去偏步骤以优化估计结果。
- 基于权重矩阵的“火花数”(spark)和稀疏性约束,推导出无噪声与有噪声情况下的恢复保证。
- 该方法从输出层逐层反向迭代应用,确保各层之间的一致性。
- 该方法实现为 Latent-Pursuit 算法,采用 $\rho = 10^{-2}$ 和 10,000 次迭代进行去偏处理,采用固定的 $\ell_2$-正则化优化框架。
实验结果
研究问题
- RQ1在何种一般条件下,深度生成模型可实现唯一解反演,且不依赖于反演算法?
- RQ2能否构建一种逐层反演算法,使其在无噪声和有噪声场景下均可可证明地恢复潜在向量?
- RQ3所提算法在重建精度与信号损坏鲁棒性方面与梯度下降法相比表现如何?
- RQ4能否在不假设权重独立同分布高斯分布或生成器平滑性的前提下,建立反演的理论保证?
主要发现
- Latent-Pursuit 算法的重建误差几乎与已知真实支持的“理想”解(oracle)相当,显著优于梯度下降法。
- 梯度下降法在许多重建任务中完全失效,尤其是在输入受损时,而 Latent-Pursuit 仍能保持高精度。
- 在干净数据和掩码图像修复实验中,Latent-Pursuit 在所有层上的平均重建误差均低于梯度下降法。
- 该算法在 NVIDIA 1080Ti GPU 上每张图像的运行时间约为 75 秒,尽管略长于梯度下降法,但在精度上表现更优。
- 在 45% 随机或半幅图像掩码的图像修复任务中,Latent-Pursuit 能成功重建图像和隐藏表示,而梯度下降法常出现失败。
- 该方法对噪声和信号损坏表现出鲁棒性,在有噪声情况下估计误差有界,这与理论分析一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。