[论文解读] E-swish: Adjusting Activations to Different Network Depths
该论文提出E-swish,一种可学习的激活函数,定义为 $ f(x) = \beta x \cdot \text{sigmoid}(x) $,通过引入缩放参数 $\beta$ 对Swish进行泛化。实验表明,E-swish在CIFAR-10和CIFAR-100上均优于ReLU和Swish,在WRN-10-2上分别实现1.5%和4.6%的准确率提升,最优 $\beta$ 值位于 $1 \leq \beta \leq 2$ 范围内。
Activation functions have a notorious impact on neural networks on both training and testing the models against the desired problem. Currently, the most used activation function is the Rectified Linear Unit (ReLU). This paper introduces a new and novel activation function, closely related with the new activation $Swish = x * sigmoid(x)$ (Ramachandran et al., 2017) which generalizes it. We call the new activation $E-swish = βx * sigmoid(x)$. We show that E-swish outperforms many other well-known activations including both ReLU and Swish. For example, using E-swish provided 1.5% and 4.6% accuracy improvements on Cifar10 and Cifar100 respectively for the WRN 10-2 when compared to ReLU and 0.35% and 0.6% respectively when compared to Swish. The code to reproduce all our experiments can be found at https://github.com/EricAlcaide/E-swish
研究动机与目标
- 为解决ReLU和Swish在深层网络中的局限性,提出一种更具适应性的激活函数。
- 探究通过可学习参数 $\beta$ 对Swish函数进行缩放是否能改善训练动态和模型准确率。
- 评估E-swish作为标准CNN架构中ReLU的即插即用替代品,无需重新调整超参数。
- 确定防止梯度消失或爆炸的同时最大化性能增益的 $\beta$ 最优范围。
- 在不同网络深度和架构(尤其是WRN-16-4等深层模型)中展示一致的性能提升。
提出的方法
- 提出E-swish为 $ f(x) = \beta x \cdot \text{sigmoid}(x) $,即在Swish基础上引入可学习缩放参数 $\beta$ 的泛化形式。
- 推导出E-swish的解析梯度为 $ f'(x) = f(x) + \sigma(x)(\beta - f(x)) $,表明其依赖于 $\beta$ 且具有非单调特性。
- 在CIFAR-10和CIFAR-100上采用标准训练协议(SGD、学习率调度)使用WRN-10-2和WRN-16-4架构进行实验。
- 使用专为ReLU设计的相同超参数以确保公平比较,仅替换激活函数。
- 采用批量归一化以稳定训练,并支持使用E-swish的深层网络收敛。
- 在多个 $\beta$ 值(1.0至2.0)范围内进行验证,以确定不同架构和数据集下的最优缩放参数。
实验结果
研究问题
- RQ1通过可学习参数 $\beta$ 对Swish激活函数进行缩放,是否能在不同网络深度上持续提升ReLU和Swish的性能?
- RQ2能够最大化模型准确率并避免梯度消失或爆炸的 $\beta$ 最优范围是什么?
- RQ3E-swish能否在无需重新调整超参数的情况下直接作为ReLU的即插即用替代品,同时优于ReLU和Swish?
- RQ4在CIFAR-100上,E-swish在WRN-16-4等深层架构上的表现如何,相较于ReLU和Swish?
- RQ5E-swish的非单调特性是否有助于改善深层网络中的梯度流动并实现更快收敛?
主要发现
- 在WRN-10-2上,E-swish在CIFAR-100上相比ReLU实现1.5%的测试准确率提升,相比Swish提升0.35%,$\beta = 1.5$。
- 在CIFAR-100上使用WRN-16-4时,E-swish在 $\beta = 1.25$ 时达到77.35%的准确率,优于ReLU(75.92%)1.43%,优于Swish 0.47%。
- E-swish在多个 $\beta$ 值下均表现出一致的性能增益,最优性能出现在 $1 \leq \beta \leq 2$ 范围内。
- 较高的 $\beta$ 值(如 $\beta = 2$)导致性能下降,表明梯度幅度过大与稳定性之间存在权衡。
- 即使在为ReLU调优超参数的情况下,E-swish仍持续优于ReLU和Swish,表明其具备鲁棒性与泛化能力。
- E-swish的非单调特性和平滑梯度特性被证实与更优的训练动态及深层网络中的更好收敛性相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。