Skip to main content
QUICK REVIEW

[论文解读] Padé Activation Units: End-to-end Learning of Flexible Activation Functions in Deep Networks

Alejandro Molina, Patrick Schramowski|arXiv (Cornell University)|Jul 15, 2019
Advanced Neural Network Applications参考文献 34被引用 16
一句话总结

本文提出了Padé激活单元(PAUs),一种基于Padé逼近的有理函数可学习激活函数,支持深层网络的端到端训练,具备灵活可适应的非线性特性。PAUs在多个基准测试中优于固定和可学习的激活函数,在ImageNet上实现了最先进准确率,并展现出极低参数开销下的稳定、鲁棒训练。

ABSTRACT

The performance of deep network learning strongly depends on the choice of the non-linear activation function associated with each neuron. However, deciding on the best activation is non-trivial, and the choice depends on the architecture, hyper-parameters, and even on the dataset. Typically these activations are fixed by hand before training. Here, we demonstrate how to eliminate the reliance on first picking fixed activation functions by using flexible parametric rational functions instead. The resulting Padé Activation Units (PAUs) can both approximate common activation functions and also learn new ones while providing compact representations. Our empirical evidence shows that end-to-end learning deep networks with PAUs can increase the predictive performance. Moreover, PAUs pave the way to approximations with provable robustness. https://github.com/ml-research/pau

研究动机与目标

  • 消除深度学习中对人工选择的固定激活函数的依赖。
  • 开发一种灵活且参数高效的激活函数,支持端到端训练。
  • 使深层网络能够学习到针对数据和网络结构定制的最优激活形状。
  • 提供一种通用逼近器,具备稳定且不消失的梯度,同时参数成本极低。
  • 通过实证验证,PAUs在多种架构和数据集上均能提升预测性能。

提出的方法

  • PAUs将激活函数表示为有理函数形式 $ F(x) = \frac{P(x)}{Q(x)} $,其中 $ P(x) $ 和 $ Q(x) $ 分别为 $ m $ 阶和 $ n $ 阶多项式。
  • Padé逼近的系数通过反向传播进行学习,从而实现对激活函数的端到端优化。
  • 该方法采用一种参数化方式,确保数值稳定性并避免梯度爆炸。
  • PAUs仅需每层增加10个额外参数,即可无缝集成到标准深度学习框架中。
  • 该方法基于Padé逼近理论,支持紧凑且表达力强的函数表示。
  • 理论分析表明,Padé网络是通用逼近器,满足关键的函数假设条件。

实验结果

研究问题

  • RQ1有理函数能否作为深度神经网络中有效且可学习的激活函数?
  • RQ2通过Padé逼近实现激活函数的端到端学习,是否能相比固定或人工设计的激活函数提升预测性能?
  • RQ3PAUs能否在深层网络中实现更快收敛并避免梯度消失问题?
  • RQ4PAUs在多种架构和数据集(包括ImageNet)上的性能表现如何?
  • RQ5能否通过将PAUs映射为ReLU网络,推导出具有可证明鲁棒性或全局最优性的模型?

主要发现

  • 在MobileNetV2上,PAUs在ImageNet上实现了最高的top-1准确率(71.35%),优于Swish(71.24%)及其他所有基线模型。
  • PAUs在top-5准确率上达到89.85%,仅次于Swish(89.95%),展现出强大的泛化能力。
  • 在15项实验中的12项,PAUs表现优于或匹配最佳基线,且在41项不同架构的top-1准确率比较中,PAUs对Swish实现了41胜0负。
  • 与所有其他激活函数相比,PAUs展现出更快的收敛速度和更低的训练损失,表明其训练过程稳定且高效。
  • 在41项不同模型的实验中,PAU家族在34至41项实验中优于所有基线,每种基线仅出现1至8次失利。
  • PAUs对梯度问题表现出鲁棒性,表现为学习曲线迅速上升,且未观察到梯度消失现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。