Skip to main content
QUICK REVIEW

[论文解读] Path-Normalized Optimization of Recurrent Neural Networks with ReLU Activations

Behnam Neyshabur, Yuhuai Wu|arXiv (Cornell University)|May 23, 2016
Topic Modeling参考文献 12被引用 16
一句话总结

本文提出 Path-SGD,一种针对具有 ReLU 激活函数的循环神经网络(RNNs)的几何感知优化方法,通过将前馈网络中的路径归一化方法适配到共享权重的 RNN 架构中。实验表明,Path-SGD 显著提升了长序列任务上的训练稳定性和性能,在 750 长度的加法序列任务中实现 0% 错误率,而标准 SGD 甚至 LSTM 均告失败,且在语言建模基准测试中将普通 RNN 与 LSTM 之间的性能差距缩小了 50%以上。

ABSTRACT

We investigate the parameter-space geometry of recurrent neural networks (RNNs), and develop an adaptation of path-SGD optimization method, attuned to this geometry, that can learn plain RNNs with ReLU activations. On several datasets that require capturing long-term dependency structure, we show that path-SGD can significantly improve trainability of ReLU RNNs compared to RNNs trained with SGD, even with various recently suggested initialization schemes.

研究动机与目标

  • 解决因梯度消失或爆炸导致的普通 ReLU RNN 训练困难问题。
  • 理解 RNN 作为具有共享权重的前馈网络子类的参数空间几何特性。
  • 开发一种针对该几何特性的优化方法,以改善收敛性和泛化能力。
  • 证明更好的优化方法可在长期依赖性任务中超越架构复杂性(如 LSTM)的性能。
  • 使简单、低复杂度的 RNN 在移动平台等资源受限环境中具备实际部署可行性。

提出的方法

  • 使用有向无环图(G)和参数共享映射(π)将 RNN 形式化为具有共享权重的前馈网络。
  • 将前馈网络中的路径范数方法适配到 RNN 中,定义一种尊重权重共享和尺度不变性的几何结构。
  • 推导出 Path-SGD 作为路径范数下的最速下降法,通过在路径范数正则化损失上进行梯度下降来更新参数。
  • 利用路径范数对梯度进行归一化,降低对权重尺度的敏感性,稳定优化动态。
  • 将 Path-SGD 与 Adam 优化器结合,以在大规模语言建模任务中实现更快收敛。
  • 在合成任务(加法问题)和真实基准(PTB、text8)上应用该方法,并与标准 SGD 和 LSTM 进行消融实验。

实验结果

研究问题

  • RQ1由于权重共享,RNN 的参数空间几何特性与标准前馈网络有何不同?
  • RQ2在前馈网络中有效的路径归一化方法,能否扩展到具有共享权重的 RNN 中以改善优化效果?
  • RQ3与标准 SGD 和初始化策略相比,Path-SGD 是否能提升 ReLU RNN 在长序列任务上的训练稳定性和性能?
  • RQ4Path-SGD 能在多大程度上缩小普通 RNN 与更复杂模型(如 LSTM)之间的性能差距?
  • RQ5Path-SGD 是否能使简单 RNN 在长期依赖性和语言建模任务中表现优于或匹配 LSTM?

主要发现

  • Path-SGD 在 750 长度加法问题上实现了 0% 测试错误率,而所有其他方法(包括 LSTM)均失败。
  • 在 PTB 语言建模数据集上,RNN-Path 达到 1.47 BPC,优于 ReLU RNN 的 1.55 BPC,且与 LSTM(1.41 BPC)的差距缩小了 57%。
  • 在 text8 数据集上,RNN-Path 达到 1.58 BPC,优于 ReLU RNN 的 1.65 BPC,且与 LSTM(1.52 BPC)的差距缩小了 54%。
  • 即使采用恒等初始化,Path-SGD 仍使简单 RNN 成功解决 750 长度加法任务,凸显其对初始化的鲁棒性。
  • Path-SGD 在序列 MNIST 上提升了泛化能力,达到与最先进 RNN 变体相当的误差率。
  • 该方法表现出对权重尺度更低的敏感性,优化动态更稳定,表明其与 RNN 的内在几何结构具有更好的对齐性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。