Skip to main content
QUICK REVIEW

[论文解读] Neural networks with differentiable structure

Thomas Miconi|arXiv (Cornell University)|Jun 20, 2016
Advanced Neural Network Applications参考文献 4被引用 10
一句话总结

本文提出了一种可微分方法,用于训练具有动态可调架构的循环神经网络,通过在输出权重上使用L1正则化,实现基于梯度的神经元剪枝与生长。该方法使网络能够根据任务复杂度自动扩展或收缩规模,在序列预测任务上表现优于固定规模的网络,通过梯度下降实现结构自适应。

ABSTRACT

While gradient descent has proven highly successful in learning connection weights for neural networks, the actual structure of these networks is usually determined by hand, or by other optimization algorithms. Here we describe a simple method to make network structure differentiable, and therefore accessible to gradient descent. We test this method on recurrent neural networks applied to simple sequence prediction problems. Starting with initial networks containing only one node, the method automatically builds networks that successfully solve the tasks. The number of nodes in the final network correlates with task difficulty. The method can dynamically increase network size in response to an abrupt complexification in the task; however, reduction in network size in response to task simplification is not evident for reasonable meta-parameters. The method does not penalize network performance for these test tasks: variable-size networks actually reach better performance than fixed-size networks of higher, lower or identical size. We conclude by discussing how this method could be applied to more complex networks, such as feedforward layered networks, or multiple-area networks of arbitrary shape.

研究动机与目标

  • 使梯度下降不仅能够优化连接权重,还能优化网络结构,如神经元数量和连接方式。
  • 解决深度学习中固定架构的局限性,即网络拓扑通常需人工设计或通过不可微方法优化。
  • 探究动态增长网络是否在性能和样本效率方面优于固定规模网络。
  • 开发一种使网络结构可微分的方法,从而支持端到端反向传播训练。
  • 证明基于梯度优化的结构自适应在应对任务复杂度变化时的可行性。

提出的方法

  • 在每个神经元的输出权重上引入L1正则化,以促进稀疏且活跃的连接,当输出贡献最小时实现神经元的‘软删除’。
  • 为总输出权重范数低于该值的神经元定义一个删除阈值 $T_D$,标记其为潜在删除对象。
  • 维持 $k$ 个次阈值神经元;若超过 $k$ 个,则以概率 $P_{\text{del}}$ 概率性地删除多余神经元。
  • 若次阈值神经元少于 $k$ 个,则添加一个新神经元,初始权重随机设置,确保其输出L1范数等于 $T_D$,以最小化初始影响。
  • 通过概率性添加与删除稳定训练过程,避免结构突变,实现平滑适应。
  • 从单个神经元开始训练,遵循‘拓扑增强’原则,仅在必要时允许网络增长。

实验结果

研究问题

  • RQ1网络架构,特别是神经元数量,能否实现可微分并基于梯度下降进行优化?
  • RQ2在序列预测任务中,动态增长的网络架构是否优于固定规模网络?
  • RQ3网络能否自动根据任务复杂度的突然增加而调整自身规模?
  • RQ4基于梯度下降的结构自适应是否能有效将网络规模与任务难度相关联?
  • RQ5该方法能否扩展至更复杂的架构,如前馈网络或多区域网络?

主要发现

  • 可变规模网络在所有测试的固定规模网络中实现了最低的中位交叉熵损失,包括与最终规模相同(37个神经元)的网络,表明其通过结构自适应实现了更优性能。
  • 在简单任务中,网络在100,000次训练周期后稳定在14个神经元;在困难任务中,其增长至37个神经元,展示了对任务难度的规模自适应能力。
  • 当任务复杂度在33,000个周期后从简单突然变为困难时,网络成功扩展至更多神经元,随后在复杂度恢复后收缩,性能保持稳定。
  • 该方法实现了无性能下降的动态结构变化,表现出对任务突变的鲁棒性。
  • 网络根据任务需求实现增长与收缩的能力表明,基于梯度下降的结构优化可产生比静态设计更高效的架构。
  • 结果支持‘拓扑增强’假设——即从较小规模开始,仅在需要时增长——可提升学习性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。