Skip to main content
QUICK REVIEW

[论文解读] Adaptive Blending Units: Trainable Activation Functions for Deep Neural Networks

Leon René Sütfeld, Flemming Brieger|arXiv (Cornell University)|Jun 26, 2018
Domain Adaptation and Few-Shot Learning被引用 9
一句话总结

本文提出自适应混合单元(ABUs),一种可训练的多个激活函数的线性组合,使深度神经网络能够在训练过程中学习最优的激活函数形状与缩放系数。ABUs 通过随时间动态调整其形式与尺度,显著优于标准激活函数,性能提升主要源于动态适应能力,而非收敛至固定最优形状。

ABSTRACT

The most widely used activation functions in current deep feed-forward neural networks are rectified linear units (ReLU), and many alternatives have been successfully applied, as well. However, none of the alternatives have managed to consistently outperform the rest and there is no unified theory connecting properties of the task and network with properties of activation functions for most efficient training. A possible solution is to have the network learn its preferred activation functions. In this work, we introduce Adaptive Blending Units (ABUs), a trainable linear combination of a set of activation functions. Since ABUs learn the shape, as well as the overall scaling of the activation function, we also analyze the effects of adaptive scaling in common activation functions. We experimentally demonstrate advantages of both adaptive scaling and ABUs over common activation functions across a set of systematically varied network specifications. We further show that adaptive scaling works by mitigating covariate shifts during training, and that the observed advantages in performance of ABUs likewise rely largely on the activation function's ability to adapt over the course of training.

研究动机与目标

  • 解决深度学习中激活函数特性与任务及网络特性之间缺乏统一理论联系的问题。
  • 探究允许网络学习自身激活函数是否能提升训练效率与性能。
  • 分离分析激活函数中形状自适应与缩放自适应的独立影响。
  • 评估 ABUs——基础激活函数的可学习组合——是否能超越固定或人工缩放的替代方案。
  • 确定性能提升是由训练过程中的持续适应驱动,还是由最终收敛至某一固定最优形状所致。

提出的方法

  • 提出自适应混合单元(ABUs)作为多个基础激活函数(如 ReLU、ELU、tanh)的可学习线性组合,每层具有可学习的混合权重。
  • 通过为每层学习单个缩放参数,引入自适应缩放机制,例如 α·ReLU(x)、α·ELU(x) 或 α·tanh(x)。
  • 对 ABUs 中的混合权重进行归一化,以隔离形状自适应与缩放的影响,从而实现仅形状自适应的分析。
  • 在 CIFAR-10 上采用标准训练协议(Adam 优化器、He 初始化),使用小型全连接网络(SMCN)评估性能。
  • 通过消融实验,使用预训练的缩放与混合权重,并在初始值为前序运行最终值的基础上,比较固定与自适应设置的性能差异。
  • 通过追踪训练过程中前激活统计量,分析协变量偏移的缓解效果,从而将稳定性与性能提升关联起来。

实验结果

研究问题

  • RQ1在训练过程中学习激活函数的形状与缩放是否能持续提升性能,相比固定激活函数?
  • RQ2ABUs 的性能提升在多大程度上源于自适应形状,而非自适应缩放?
  • RQ3仅自适应缩放是否足以稳定前激活统计量并减少训练过程中的协变量偏移?
  • RQ4ABUs 的性能优势是源于收敛至固定最优形状,还是训练过程中的持续适应起关键作用?
  • RQ5不同 ABU 混合权重的归一化策略如何影响性能?这揭示了缩放在其中的重要性如何?

主要发现

  • 在 CIFAR-10 上,ABUs 在多种网络架构与超参数设置下均持续优于标准激活函数。
  • 对标准激活函数(如 α·ReLU、α·ELU)进行自适应缩放可显著提升性能,通过稳定前激活统计量并减少协变量偏移。
  • ABUs 的性能提升主要源于网络随时间动态调整激活函数形状的能力,而非仅收敛至固定最优形式。
  • 在初始化后将混合权重固定为预训练值,大多数 ABU 变体性能均下降,表明持续适应至关重要。
  • 在预训练后对混合权重进行归一化,性能优于非归一化预训练,但默认初始化为 1/m 时仍表现最佳,表明未归一化的 ABUs 更具有效性。
  • 例外情况是 ABU soft,其在固定预训练混合权重时略有改善,但在自适应权重下性能下降,表明其对初始化与归一化方式高度敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。