Skip to main content
QUICK REVIEW

[论文解读] Flexible Rectified Linear Units for Improving Convolutional Neural Networks

Suo Qiu, Bolun Cai|arXiv (Cornell University)|Jun 25, 2017
Advanced Neural Network Applications参考文献 18被引用 7
一句话总结

本文提出灵活修正线性单元(FReLU),一种可学习的激活函数,通过将ReLU的固定零点替换为可训练的阈值,使网络能够利用负值,从而提升模型表达能力。FReLU在CIFAR-10、CIFAR-100和ImageNet数据集上,无论在普通网络还是残差网络中,均实现了比ReLU更快的收敛速度和更高的准确率,且计算开销极低。

ABSTRACT

Rectified linear unit (ReLU) is a widely used activation function for deep convolutional neural networks. However, because of the zero-hard rectification, ReLU networks miss the benefits from negative values. In this paper, we propose a novel activation function called \emph{flexible rectified linear unit (FReLU)} to further explore the effects of negative values. By redesigning the rectified point of ReLU as a learnable parameter, FReLU expands the states of the activation output. When the network is successfully trained, FReLU tends to converge to a negative value, which improves the expressiveness and thus the performance. Furthermore, FReLU is designed to be simple and effective without exponential functions to maintain low cost computation. For being able to easily used in various network architectures, FReLU does not rely on strict assumptions by self-adaption. We evaluate FReLU on three standard image classification datasets, including CIFAR-10, CIFAR-100, and ImageNet. Experimental results show that the proposed method achieves fast convergence and higher performances on both plain and residual networks.

研究动机与目标

  • 为解决ReLU固定零点整流带来的局限性,即丢弃负值并限制网络表达能力。
  • 探究可学习的激活阈值是否能增强深度卷积神经网络中的特征表示与模型性能。
  • 设计一种简单高效、计算成本低但能自适应学习整流点的激活函数。
  • 在多种网络架构和基准数据集上评估所提出FReLU的泛化能力与有效性。

提出的方法

  • FReLU通过引入一个可学习参数来修改ReLU激活函数,该参数控制负值被截断的点,从而替代固定的零阈值。
  • 激活函数定义为 FReLU(x) = max(αx, 0),其中 α 是一个可训练的标量参数,可在反向传播过程中自适应调整。
  • 可学习参数 α 通过端到端训练进行优化,使网络能够自动学习最优的整流阈值。
  • FReLU设计中不包含指数运算,以保持计算效率,并确保与现有深度学习框架的兼容性。
  • 该方法被应用于普通网络和残差网络架构,以评估其在不同模型设计下的泛化能力。
  • 训练过程采用标准反向传播,对网络权重和 α 参数同时进行梯度更新。

实验结果

研究问题

  • RQ1与固定ReLU相比,ReLU激活函数中引入可学习阈值是否能提升深度卷积神经网络的性能?
  • RQ2通过可训练的整流点允许负值参与,是否能增强特征表示与模型表达能力?
  • RQ3在标准图像分类基准上,FReLU在收敛速度和最终准确率方面表现如何?
  • RQ4FReLU在不同网络架构(如普通网络和残差网络)上的泛化能力如何?
  • RQ5在激活函数中引入可学习参数是否会带来显著的计算开销?

主要发现

  • 在所有评估的数据集上,FReLU的训练收敛速度均快于标准ReLU。
  • 在CIFAR-10上,FReLU在普通网络和残差网络中均实现了比ReLU更高的top-1准确率,实验中报告了可测量的性能提升。
  • 在CIFAR-100上,FReLU表现出一致的性能改进,表明其在更复杂的分类任务中也具有鲁棒性。
  • 在ImageNet上,FReLU在保持快速收敛的同时实现了比ReLU更高的准确率,证实了其在大规模数据集上的可扩展性。
  • FReLU中学习到的参数 α 在训练过程中倾向于收敛为负值,表明网络从负激活的利用中获益。
  • 由于未使用指数函数,FReLU保持了极低的计算成本,适用于资源受限环境的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。