Skip to main content
QUICK REVIEW

[论文解读] Learning Compact Neural Networks Using Ordinary Differential Equations as Activation Functions

MohamadAli Torkamani, Phillip Wallis|arXiv (Cornell University)|May 19, 2019
Model Reduction and Neural Networks参考文献 15被引用 5
一句话总结

本文提出微分方程单元(DEUs),其中每个神经元通过求解一个可训练的二阶常微分方程(ODE)来学习个性化的非线性激活函数。通过为每个神经元学习五个参数——系数和初始条件,DEUs 实现了紧凑且高性能的神经网络,其性能与使用固定激活函数(如 ReLU)的更大模型相当或更优,在 CIFAR-10 上以更少的参数实现超过 1% 的准确率提升。

ABSTRACT

Most deep neural networks use simple, fixed activation functions, such as sigmoids or rectified linear units, regardless of domain or network structure. We introduce differential equation units (DEUs), an improvement to modern neural networks, which enables each neuron to learn a particular nonlinear activation function from a family of solutions to an ordinary differential equation. Specifically, each neuron may change its functional form during training based on the behavior of the other parts of the network. We show that using neurons with DEU activation functions results in a more compact network capable of achieving comparable, if not superior, performance when is compared to much larger networks.

研究动机与目标

  • 解决大型深度神经网络在移动设备和可穿戴设备等资源受限环境中的计算和内存低效问题。
  • 克服固定激活函数(如 ReLU、Sigmoid)无法根据网络结构或数据分布自适应调整的局限性。
  • 使每个神经元能够从 ODE 解的丰富家族中动态学习其自身的非线性激活函数,从而在不增加模型大小的前提下提升表征能力。
  • 开发一种可训练、参数高效的激活函数学习机制,减少网络规模的同时保持或提升性能。

提出的方法

  • 每个神经元的激活值由一个二阶线性 ODE 的解导出:$ a y''(t) + b y'(t) + c y(t) = u(t) $,其中 $ u(t) $ 为 Heaviside 阶跃函数。
  • 五个可学习参数——$ a, b, c, c_1, c_2 $——通过反向传播进行优化,以在训练过程中自适应调整激活函数。
  • 通过显式投影处理奇异子空间(如 $ a=0 $、$ b=0 $ 或 $ c=0 $)以避免数值不稳定并确保可微性。
  • 采用正则化策略使 $ b^2 - 4ac $ 接近 $ \sqrt{4ac} $,以防止解出现指数级发散。
  • 使用批量归一化和网络参数与 DEU 参数的独立学习率,以稳定训练并防止梯度爆炸。
  • 利用符号计算(Maple)预计算解,并编译为 GPU 并行推理的优化代码。

实验结果

研究问题

  • RQ1通过允许每个神经元学习其自身的激活函数,神经网络是否能在参数更少的情况下实现更高性能?
  • RQ2学习一种动态的、基于 ODE 的激活函数,是否相比固定激活函数能带来更好的泛化能力和模型紧凑性?
  • RQ3二阶 ODE 的解空间是否具备足够的表达能力以替代标准激活函数,同时保持可训练性和稳定性?
  • RQ4在不同架构下,DEU 在准确率和模型大小方面与 ReLU、PReLU 和 Swish 相比表现如何?

主要发现

  • 在 CIFAR-10 上使用 ResNet-18 时,DEUs 的准确率比 ReLU、PReLU 和 Swish 高出 1% 以上,表明其在无架构修改下具有卓越性能。
  • DEUs 显著缩小了完整 ResNet-18 与仅含一半块结构的简化版本之间的性能差距,表明其在紧凑网络设计中具有强大效率。
  • 在 MNIST 和 Fashion-MNIST 上,基于 DEU 的网络在参数显著更少的情况下,实现了与标准 ReLU 网络相当或更优的准确率。
  • 该方法使神经元能够根据学习到的 ODE 参数动态采用多样化函数形式——如周期性、指数型或二次型——从而增强表征能力。
  • 训练过程通过将接近零的系数投影为零,并稳定接近临界判别式的参数,成功避免了奇异子空间,确保了优化的鲁棒性。
  • 使用独立学习率和批量归一化有效防止了梯度爆炸,并在高度非线性激活函数下稳定了训练过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。