Skip to main content
QUICK REVIEW

[论文解读] Symmetrical Gaussian Error Linear Units (SGELUs)

Chao Yu, Zhiguo Su|arXiv (Cornell University)|Nov 10, 2019
Numerical Methods and Algorithms参考文献 11被引用 4
一句话总结

该论文提出了一种新型激活函数——对称高斯误差线性单元(SGELU),通过结合GELU的随机正则化特性与对称性,实现双向优化并缓解梯度消失问题。在MNIST分类与自编码任务中,SGELU相较于GELU和LiSHT展现出更优的收敛速度与准确率,同时通过高效的极小-极大归一化技术,改善了权重分布并减少了对批量归一化的依赖。

ABSTRACT

In this paper, a novel neural network activation function, called Symmetrical Gaussian Error Linear Unit (SGELU), is proposed to obtain high performance. It is achieved by effectively integrating the property of the stochastic regularizer in the Gaussian Error Linear Unit (GELU) with the symmetrical characteristics. Combining with these two merits, the proposed unit introduces the capability of the bidirection convergence to successfully optimize the network without the gradient diminishing problem. The evaluations of SGELU against GELU and Linearly Scaled Hyperbolic Tangent (LiSHT) have been carried out on MNIST classification and MNIST auto-encoder, which provide great validations in terms of the performance, the convergence rate among these applications.

研究动机与目标

  • 通过在激活函数中引入对称特性,缓解深度网络中的梯度消失问题。
  • 通过整合GELU的随机正则化特性与对称输出行为,提升模型性能。
  • 通过设计与轻量级归一化技术兼容的激活函数,降低对批量归一化的依赖。
  • 在分类与自编码任务中,验证SGELU相较于GELU和LiSHT的优越性。

提出的方法

  • 提出SGELU作为GELU的对称变体,其公式为 $ SGELU(x) = \alpha x \cdot \mathrm{erf}\left(\frac{x}{\sqrt{2}}\right) $,其中 $ \alpha $ 为可学习超参数。
  • 在SGELU输出后引入一种极小-极大归一化技术以稳定训练,替代批量归一化。
  • 利用链式法则推导梯度并分析权重更新,表明SGELU在负输入区域仍能保持非零梯度。
  • 采用Kolmogorov-Smirnov检验验证SGELU权重服从正态分布,从而增强模型鲁棒性。
  • 通过MNIST分类与自编码器基准,对比ReLU、ELU、GELU、LiSHT与SGELU的训练动态与损失收敛表现。
  • 分析SGELU与Dropout不兼容的原因,因其在负区域具有非稀疏激活特性。

实验结果

研究问题

  • RQ1与GELU和LiSHT相比,对称激活函数是否能改善深度网络中的梯度流动与收敛性?
  • RQ2SGELU中随机正则化与对称性的结合如何影响权重分布与模型泛化能力?
  • RQ3SGELU是否能减少对批量归一化的依赖?如果是,何种替代归一化技术可实现相当或更优的性能?
  • RQ4SGELU为何在与Dropout结合时表现不佳?其激活行为与ReLU和GELU在该场景下有何不同?
  • RQ5在MNIST分类与自编码任务中,SGELU相较于GELU和LiSHT在准确率与收敛速度方面优势有多大?

主要发现

  • 在MNIST分类任务中,SGELU的收敛速度更快,测试准确率高于GELU与LiSHT,且训练与测试损失下降更平滑。
  • 在MNIST自编码任务中,SGELU在五次运行的中位数结果中,无论是训练还是测试性能,均优于GELU与LiSHT。
  • SGELU网络的权重在八个隐藏层中的七个通过了Kolmogorov-Smirnov正态性检验,而GELU仅在两个层中通过,表明其权重分布更优。
  • SGELU在不使用批量归一化的情况下,实现了与GELU相当或更优的准确率,转而采用计算成本更低的极小-极大归一化。
  • 在SGELU后使用极小-极大归一化显著缩短了训练时间,因其计算复杂度低于批量归一化。
  • SGELU与Dropout兼容性差,因其在负区域的非零激活导致神经元无法实现稀疏化,使Dropout效果降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。