[论文解读] TanhExp: A Smooth Activation Function with High Convergence Speed for Lightweight Neural Networks
本文提出一种平滑的、非分段的激活函数 TanhExp,定义为 $ f(x) = x \tanh(e^x) $,在不增加参数数量的前提下,提升了轻量级神经网络的收敛速度和精度。在 MNIST、Fashion-MNIST、CIFAR-10 和 CIFAR-100 上,其训练速度更快,性能优于 ReLU、Mish 和 Swish,且在 LeNet 模型上对 CIFAR-100 的测试准确率最高比 Mish 提高 6.5%。
Lightweight or mobile neural networks used for real-time computer vision tasks contain fewer parameters than normal networks, which lead to a constrained performance. In this work, we proposed a novel activation function named Tanh Exponential Activation Function (TanhExp) which can improve the performance for these networks on image classification task significantly. The definition of TanhExp is f(x) = xtanh(e^x). We demonstrate the simplicity, efficiency, and robustness of TanhExp on various datasets and network models and TanhExp outperforms its counterparts in both convergence speed and accuracy. Its behaviour also remains stable even with noise added and dataset altered. We show that without increasing the size of the network, the capacity of lightweight neural networks can be enhanced by TanhExp with only a few training epochs and no extra parameters added.
研究动机与目标
- 解决由于模型尺寸和训练时间受限,导致轻量级神经网络性能受限的问题。
- 在移动设备和实时视觉应用中,克服 ReLU 的缺点,如非零均值激活和神经元死亡问题。
- 设计一种简单、高效且鲁棒的激活函数,提升收敛速度和精度,同时不增加模型复杂度。
- 证明 TanhExp 在不增加参数的前提下增强网络容量,实现更快的收敛速度和在小数据集上的更好泛化能力。
提出的方法
- 提出一种新型激活函数 TanhExp,定义为 $ f(x) = x \cdot \tanh(e^x) $,结合了平滑性和近似线性特性。
- 确保该函数处处连续且可微,具有负值以使激活值的均值接近零,从而加速学习过程。
- 利用双曲正切函数中的指数项,实现平滑过渡,避免硬截断,缓解神经元死亡问题。
- 设计该函数在计算上高效,仅比 ReLU 略多一点计算量,与 Swish 相当,同时优于更复杂的函数如 Mish。
- 在多种轻量级网络架构(如 LeNet、ResNet-20、ResNet-32)中实现 TanhExp,并在多个数据集上使用固定超参数进行评估。
- 采用标准指标评估性能:测试准确率、收敛速度、对噪声的鲁棒性以及计算时间。
实验结果
研究问题
- RQ1一种平滑的、非分段的激活函数是否能在不增加模型大小或参数数量的前提下,提升轻量级神经网络的收敛速度和精度?
- RQ2在训练速度、最终准确率和数据扰动下的鲁棒性方面,TanhExp 与 ReLU、Mish 和 Swish 相比如何?
- RQ3TanhExp 在包括 MNIST、Fashion-MNIST、CIFAR-10 和 CIFAR-100 在内的多种数据集上,特别是在浅层和小型网络架构中,是否能保持高性能?
- RQ4TanhExp 是否在计算效率上足够高,可实际应用于实时移动和嵌入式视觉系统?
- RQ5TanhExp 是否能通过改善梯度流动和激活值均值中心化,提升轻量级网络的表征能力?
主要发现
- 在 MNIST 数据集上使用 15 层网络,TanhExp 仅用一个训练周期就达到 89.86% 的测试准确率,显著优于 Swish(40.30%)和 Mish(65.68%)。
- 在 CIFAR-100 上,TanhExp 相较于 ReLU 提高了 5% 的测试准确率,相较于 Mish 提高了 6.5%,相较于 Swish 提高了 4.7%(在 LeNet 模型上)。
- TanhExp 展现出比所有基线方法更快的收敛速度,达到相当或更优准确率所需的训练周期更少。
- 该函数在噪声和数据分布偏移下仍保持稳定性能,表现出强鲁棒性。
- 在计算方面,TanhExp 的速度约为 Mish 的两倍,与 Swish 相当,且由于收敛更快,总训练时间显著低于 ReLU。
- 由于收敛更快且每步计算量更低,TanhExp 在准确率-速度权衡方面优于所有对比的激活函数,包括 ReLU。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。