Skip to main content
QUICK REVIEW

[论文解读] Surfing: Iterative optimization over incrementally trained deep networks

Ganlin Song, Zhou Fan|arXiv (Cornell University)|Jul 19, 2019
Sparse and Compressive Sensing Techniques参考文献 19被引用 4
一句话总结

本文提出了一种名为'surfing'的迭代优化方法,利用逐步训练的深度网络提升生成模型的输入恢复性能。通过依次使用逐步训练的网络参数 $\theta_t$ 对输入 $x$ 进行优化,该方法从初始平滑的损失曲面逐步过渡到最终复杂的形态,从而在收敛性上优于直接在最终模型上进行梯度下降。

ABSTRACT

We investigate a sequential optimization procedure to minimize the empirical risk functional $f_{\hatθ}(x) = \frac{1}{2}\|G_{\hatθ}(x) - y\|^2$ for certain families of deep networks $G_θ(x)$. The approach is to optimize a sequence of objective functions that use network parameters obtained during different stages of the training process. When initialized with random parameters $θ_0$, we show that the objective $f_{θ_0}(x)$ is "nice'' and easy to optimize with gradient descent. As learning is carried out, we obtain a sequence of generative networks $x \mapsto G_{θ_t}(x)$ and associated risk functions $f_{θ_t}(x)$, where $t$ indicates a stage of stochastic gradient descent during training. Since the parameters of the network do not change by very much in each step, the surface evolves slowly and can be incrementally optimized. The algorithm is formalized and analyzed for a family of expansive networks. We call the procedure {\it surfing} since it rides along the peak of the evolving (negative) empirical risk function, starting from a smooth surface at the beginning of learning and ending with a wavy nonconvex surface after learning is complete. Experiments show how surfing can be used to find the global optimum and for compressed sensing even when direct gradient descent on the final learned network fails.

研究动机与目标

  • 解决在最终训练网络上直接使用梯度下降优化生成模型输入时,由于非凸损失曲面而导致失败的挑战。
  • 利用随机训练过程中网络参数的渐进演化,实现对输入 $x$ 的稳定、渐进式优化。
  • 形式化并分析一种新颖算法——surfing,该算法沿着从随机初始化到完整训练的演化经验风险曲面进行优化。
  • 证明surfing在压缩感知与全局最优解恢复方面优于直接在最终模型上进行优化。

提出的方法

  • 该方法在每个训练阶段 $t$ 从上一网络 $G_{\theta_{t-1}}(x)$ 最小化损失时得到的输入 $x^*_{t-1}$ 出发,对 $f_{\theta_t}(x) = \frac{1}{2}\|G_{\theta_t}(x) - y\|^2$ 执行梯度下降。
  • 利用随机梯度下降中参数更新量较小的事实,确保损失曲面缓慢且连续地演化。
  • 理论分析表明,对于宽度足够的随机ReLU网络,初始损失曲面 $f_{\theta_0}(x)$ 表现良好:在 $x_0$ 和 $-x_0$ 的小邻域外,所有点均存在下降方向。
  • 理论分析中使用投影梯度下降以处理ReLU激活引起的分段二次曲面,但实际中简单梯度下降已足够有效。
  • 该算法针对扩展型ReLU网络进行了形式化,并在全局最小值点随 $t$ 连续演化这一假设下进行了分析。
  • 实验验证了该方法在VAE与GAN训练网络上的有效性,结果表明其在压缩感知与全局最优解恢复方面性能更优。

实验结果

研究问题

  • RQ1与直接在最终模型上优化相比,基于逐步训练网络的迭代优化是否能提升输入恢复性能?
  • RQ2在深度生成模型中,经验风险函数的几何结构从随机初始化到完全训练的演化过程如何?
  • RQ3在何种条件下,损失函数的全局最小值点在训练过程中保持稳定且连续,从而支持渐进式优化?
  • RQ4当直接在最终模型上使用梯度下降失败时,surfing方法是否仍能可靠地找到全局最优解?
  • RQ5对于随机初始化的网络,初始损失曲面 $f_{\theta_0}(x)$ 可提供哪些理论保证?

主要发现

  • 对于随机初始化的ReLU网络,初始损失曲面 $f_{\theta_0}(x)$ 表现良好:在 $x_0$ 和 $-x_0$ 的小邻域外,所有点均存在下降方向,从而支持可靠优化。
  • 在压缩感知与全局最优解恢复方面,surfing显著优于直接在最终模型上进行梯度下降,尤其在非凸曲面中表现更优。
  • 理论分析证实,对于扩展型ReLU网络,损失曲面演化平滑,支持渐进式优化策略。
  • 投影梯度下降在理论上对处理ReLU网络的分段二次曲面有效,但实际中简单梯度下降已足够。
  • 实证结果表明,surfing在直接优化失败时仍能保持收敛,展示了其在VAE与GAN架构中的鲁棒性。
  • 该方法假设全局最小值点随训练连续演化;若最小值点出现不连续,则算法有效性将被破坏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。