Skip to main content
QUICK REVIEW

[论文解读] Effects of the Nonlinearity in Activation Functions on the Performance of Deep Learning Models

Nalinda Kulathunga, N. R. Ranasinghe|arXiv (Cornell University)|Oct 14, 2020
Neural Networks and Applications参考文献 16被引用 12
一句话总结

本研究探讨了ReLU和Leaky-ReLU(L-ReLU)激活函数中的非线性特性如何影响不同架构和数据类型下的深度学习模型性能。基于MNIST、连续数据和FOOD-11数据集的实验表明,当模型参数受限时,L-ReLU优于ReLU;而在高参数设置和非迁移学习任务中,ReLU表现更优;而在图像数据的迁移学习场景中,L-ReLU则能提升准确率。

ABSTRACT

The nonlinearity of activation functions used in deep learning models are crucial for the success of predictive models. There are several commonly used simple nonlinear functions, including Rectified Linear Unit (ReLU) and Leaky-ReLU (L-ReLU). In practice, these functions remarkably enhance the model accuracy. However, there is limited insight into the functionality of these nonlinear activation functions in terms of why certain models perform better than others. Here, we investigate the model performance when using ReLU or L-ReLU as activation functions in different model architectures and data domains. Interestingly, we found that the application of L-ReLU is mostly effective when the number of trainable parameters in a model is relatively small. Furthermore, we found that the image classification models seem to perform well with L-ReLU in fully connected layers, especially when pre-trained models such as the VGG-16 are used for the transfer learning.

研究动机与目标

  • 理解ReLU和L-ReLU等激活函数的非线性特性如何影响深度学习模型的性能。
  • 研究模型架构形态和参数数量对不同激活函数下验证准确率的影响。
  • 评估数据领域(连续、分类、图像)在决定最优激活函数选择中的作用。
  • 探索L-ReLU在泛化能力和信息流方面相对于ReLU的优势条件。
  • 为提升模型性能,提供关于L-ReLU中非线性因子α选择的实证洞察。

提出的方法

  • 采用五种不同架构(A–E),其隐藏层节点配置各异,以评估架构对性能的影响。
  • 在所有架构和数据集上应用ReLU和L-ReLU,并设置不同的α值(从0到1)。
  • 使用交叉熵和MSE损失函数,在MNIST(手写数字)、模拟连续数据和FOOD-11(图像分类)数据集上进行模型训练。
  • 在迁移学习设置中,从预训练的VGG-16中提取瓶颈特征,并将其作为全连接网络的输入,比较不同激活函数的性能。
  • 通过不同α值和数据类型下的验证准确率与验证损失来衡量性能表现。
  • 通过观察损失行为和模型对α的敏感性(尤其是α=1等极端值)来分析信息流。

实验结果

研究问题

  • RQ1在不同模型架构下,ReLU与L-ReLU的选择如何影响模型准确率?
  • RQ2可训练参数数量是否会影响L-ReLU相对于ReLU的性能优势?
  • RQ3数据领域(如连续、图像、分类)如何影响最优激活函数的选择?
  • RQ4在迁移学习设置中使用L-ReLU会产生何种影响,特别是当使用VGG-16等模型提取的特征时?
  • RQ5为何在α变化时,验证损失在不同数据类型下的表现不同,尤其是在α=1时?

主要发现

  • 在高参数模型中,ReLU始终优于L-ReLU,在所有架构下于MNIST数据集上实现了高达约90%的验证准确率。
  • 仅当可训练参数数量相对较少时,L-ReLU才表现出相对于ReLU的性能优势,尤其在浅层或窄层网络中。
  • 在使用VGG-16瓶颈特征进行FOOD-11图像分类任务时,随着α增大,验证损失降低,表明在该迁移学习场景中L-ReLU优于ReLU。
  • 在连续数据上,当α=1时验证损失急剧上升(达到约10^4),表明ReLU的强非线性在特征与目标呈非线性关系时具有破坏性。
  • MNIST模型对α的依赖性较弱,ReLU(α=0)取得最佳验证损失,表明ReLU的强非线性有助于该领域中的特征学习。
  • 结果表明,激活函数的非线性显著影响网络中的信息流,未来通过熵基方法量化信息流可能有助于深化理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。