Skip to main content
QUICK REVIEW

[论文解读] Mollifying Networks

Çaǧlar Gülçehre, Marcin Moczulski|arXiv (Cornell University)|Aug 17, 2016
Stochastic Gradient Optimization Techniques参考文献 15被引用 4
一句话总结

本文提出Mollifying Networks,一种新颖的优化方法,通过单个退火超参数对损失函数应用可微分平滑(mollification),逐步增加模型复杂度。该方法从一个凸的、平滑的近似目标开始,逐步减少平滑度,从而提升深度非凸模型(如深层MLP和LSTM)的训练稳定性和收敛性,在奇偶性、Pentomino、CIFAR-10和语言建模任务上相比ResNet和随机深度方法达到最先进性能。

ABSTRACT

The optimization of deep neural networks can be more challenging than traditional convex optimization problems due to the highly non-convex nature of the loss function, e.g. it can involve pathological landscapes such as saddle-surfaces that can be difficult to escape for algorithms based on simple gradient descent. In this paper, we attack the problem of optimization of highly non-convex neural networks by starting with a smoothed -- or extit{mollified} -- objective function that gradually has a more non-convex energy landscape during the training. Our proposition is inspired by the recent studies in continuation methods: similar to curriculum methods, we begin learning an easier (possibly convex) objective function and let it evolve during the training, until it eventually goes back to being the original, difficult to optimize, objective function. The complexity of the mollified networks is controlled by a single hyperparameter which is annealed during the training. We show improvements on various difficult optimization tasks and establish a relationship with recent works on continuation methods for neural networks and mollifiers.

研究动机与目标

  • 为解决优化高度非凸深度神经网络的困难,特别是那些具有病态损失景观的网络。
  • 改善使用Sigmoid/Tanh激活函数的深层MLP和LSTM等深度模型的训练稳定性和收敛性。
  • 探索延续法、mollifiers与神经网络优化中自适应噪声注入之间的联系。
  • 提供一种简单、单超参数的替代方案,替代复杂的正则化或网络结构技术(如批量归一化和残差连接)。

提出的方法

  • 该方法使用mollified目标函数,初始时为原始损失的平滑凸近似,并通过单个超参数的退火过程逐步去平滑化。
  • 通过使用mollifier核实现mollification,采用可微分平滑操作,支持通过弱导数和蒙特卡洛估计计算梯度。
  • 该超参数同时控制损失中的平滑程度和网络的随机深度,使模型能够从浅层且凸的初始状态逐步演化为更深、更复杂的结构。
  • 退火调度是自适应的:根据训练或验证损失调整超参数,在性能不佳时增加噪声,在收敛时减少噪声。
  • 该方法兼容标准优化算法(如带动量的SGD),可应用于MLP、CNN和LSTM等多种架构。
  • 该方法在理论上基于延续法和分布梯度,与既有的平滑和正则化技术相联系。

实验结果

研究问题

  • RQ1损失函数的平滑凸近似是否能改善深度非凸神经网络的优化?
  • RQ2通过退火控制平滑度和随机深度的单一超参数,如何影响训练动态和收敛性?
  • RQ3mollification能否在困难优化任务上超越批量归一化和残差连接等成熟技术?
  • RQ4通过mollification实现的自适应噪声注入对泛化能力和测试性能有何影响?

主要发现

  • 在40维奇偶性任务中,使用Sigmoid激活函数的mollified MLP相比标准基线和残差连接基线收敛速度快得多。
  • 在Pentomino数据集中,mollified MLP在100个周期后达到75.15%的准确率,优于基线模型(69.5%)和先前SOTA(68.15%)。
  • 在CIFAR-10上使用110层卷积网络,mollified模型达到92.45%的测试准确率,超过ResNet(91.78%),并接近随机深度方法(93.25%)。
  • 在PTB语言建模任务中,mollified LSTM达到123.6的测试困惑度,优于基线LSTM(128.4),并表现出更快的收敛速度。
  • 基于训练损失的自适应退火调度有效调节了噪声注入,在需要时促进探索,收敛后减少噪声。
  • 该方法在多种架构和任务中均表现出改进的泛化能力和稳定性,表明mollification通过受控的噪声注入起到了正则化作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。