[论文解读] A Closer Look at Double Backpropagation
本文通过在希尔伯特空间中使用弗雷chet导数,为神经网络中的双重反向传播提供了一个统一的理论框架,实现了对涉及输入导数的梯度惩罚的优化计算。该方法将雅可比范数惩罚的计算成本降低了约三分之一,并表明批量优化可缓解基于ReLU的损失景观中的不连续性,从而在存在非光滑梯度的情况下确保训练稳定。
In recent years, an increasing number of neural network models have included derivatives with respect to inputs in their loss functions, resulting in so-called double backpropagation for first-order optimization. However, so far no general description of the involved derivatives exists. Here, we cover a wide array of special cases in a very general Hilbert space framework, which allows us to provide optimized backpropagation rules for many real-world scenarios. This includes the reduction of calculations for Frobenius-norm-penalties on Jacobians by roughly a third for locally linear activation functions. Furthermore, we provide a description of the discontinuous loss surface of ReLU networks both in the inputs and the parameters and demonstrate why the discontinuities do not pose a big problem in reality.
研究动机与目标
- 为基于导数的正则化在神经网络中的双重反向传播提供一种通用且数学严谨的描述。
- 针对涉及输入导数惩罚的实际场景,优化反向传播过程,降低时间和内存成本。
- 分析在基于导数的正则化下,(漏失)ReLU网络中损失景观的结构与不连续性。
- 解释为何梯度中的不连续性在实践中不会阻碍训练,特别是当采用批量优化时。
提出的方法
- 通过在希尔伯特空间中使用弗雷chet导数来表述双重反向传播,实现了对神经网络层的无坐标、通用处理。
- 将伴随算子理论从线性算子扩展到连续双线性算子,从而统一建模全连接、卷积和局部连接层。
- 推导出针对雅可比范数惩罚的优化反向传播规则,对于局部线性激活函数的网络,将计算复杂度降低了约三分之一。
- 通过固定网络权重并改变单个参数来分析损失景观,揭示了ReLU网络中分段仿射行为及跳跃不连续性。
- 利用批量平均来模拟平滑的损失景观,证明其对优化的稳定作用。
实验结果
研究问题
- RQ1如何系统地推导出适用于神经网络中广泛导数正则化项的双重反向传播?
- RQ2在损失函数中包含输入导数惩罚的理论与计算影响是什么?
- RQ3ReLU网络损失景观中的不连续性如何影响优化?是否可以缓解?
- RQ4为何在基于导数的损失函数中存在非光滑梯度时,批量优化仍能保持稳定?
主要发现
- 本文推导出的优化双重反向传播规则,使具有局部线性激活函数的网络在雅可比范数惩罚下,计算成本最高可降低三分之一。
- (漏失)ReLU网络的损失景观在输入和参数上均存在不连续性,其跳跃不连续性源于ReLU非线性函数的分段线性行为。
- 尽管存在不连续性,一阶优化在实践中仍保持稳定,这是由于批量平均对多个输入产生的‘伪平滑’效应。
- 在节点级惩罚(如Rnode)中,惩罚项对偏置的导数通常为零,而在经典双重反向传播(如Rcdb)中则保持非零,这是由于最后一层存在非零梯度。
- 所提出的希尔伯特空间框架通过连续双线性算子的统一处理,将全连接、卷积和局部连接层的反向传播统一起来。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。