Skip to main content
QUICK REVIEW

[论文解读] Activation Ensembles for Deep Neural Networks

Mark E. Harmon, Diego Klabjan|arXiv (Cornell University)|Feb 24, 2017
Machine Learning and Data Classification参考文献 18被引用 14
一句话总结

本文提出激活集成(activation ensembles),一种新颖的方法,通过可学习的权重(α)和自适应偏移量(η, δ),在每个神经元处动态组合多个激活函数,使深层网络能够为每层选择最优的激活函数组合。该方法在MNIST、ISOLET、CIFAR-100和STL-10数据集上均提升了性能,且通过学习到的α值提供了对激活函数动态特性的更深层次理解。

ABSTRACT

Many activation functions have been proposed in the past, but selecting an adequate one requires trial and error. We propose a new methodology of designing activation functions within a neural network at each layer. We call this technique an "activation ensemble" because it allows the use of multiple activation functions at each layer. This is done by introducing additional variables, $α$, at each activation layer of a network to allow for multiple activation functions to be active at each neuron. By design, activations with larger $α$ values at a neuron is equivalent to having the largest magnitude. Hence, those higher magnitude activations are "chosen" by the network. We implement the activation ensembles on a variety of datasets using an array of Feed Forward and Convolutional Neural Networks. By using the activation ensemble, we achieve superior results compared to traditional techniques. In addition, because of the flexibility of this methodology, we more deeply explore activation functions and the features that they capture.

研究动机与目标

  • 为解决传统方法中需通过试错选择最优激活函数的挑战。
  • 实现在每个神经元处动态、数据驱动地选择激活函数,而非在各层中固定使用单一激活函数。
  • 通过凸组合方式结合多个经过验证的激活函数的优势,提升模型准确率与特征学习能力。
  • 利用学习到的α参数,探究激活函数选择在不同网络深度、架构类型和数据集之间的变化规律。
  • 在多种架构(包括前馈网络、卷积神经网络、残差网络和自编码器)上验证激活集成方法的有效性。

提出的方法

  • 为每个神经元处的每个激活函数引入可学习参数α,形成多个激活函数的凸组合。
  • 引入偏移参数η和δ,动态调整各激活函数的归一化范围,同时保持其函数特性。
  • 通过标准反向传播优化α、η和δ参数,使网络能够学习最优的激活函数组合。
  • 采用一种新型投影算法,将α值映射至有效的凸组合空间,以保证训练稳定性和结果可解释性。
  • 将激活集成方法应用于前馈网络、卷积神经网络、残差网络和自编码器,并在自编码器中使用权重重用以保持对称性。
  • 在MNIST、ISOLET、CIFAR-100和STL-10数据集上,使用均方误差和分类准确率作为评估指标。

实验结果

研究问题

  • RQ1在不同数据集和网络架构下,每个神经元动态组合多个激活函数对深度学习性能有何影响?
  • RQ2网络是否能够学习在每一层和每个神经元处选择最优的激活函数组合,而非依赖于固定的激活函数?
  • RQ3学习到的α值如何随网络深度、架构类型和数据集的变化而变化,从而揭示激活函数的偏好规律?
  • RQ4激活集成方法是否能在CIFAR-100等具有挑战性的基准测试中提升性能,尤其是在残差网络中?
  • RQ5不同激活函数集合(如ReLU变体、sigmoid、tanh)对性能的贡献程度如何?这种贡献是否随数据集而异?

主要发现

  • 与标准激活函数相比,激活集成方法在MNIST、ISOLET和CIFAR-100数据集上实现了更高的分类准确率。
  • 在CIFAR-100数据集的残差网络中,激活集成显著提升了性能,最佳效果出现在将集成模块置于残差块中间时。
  • 学习到的α值显示,不同激活函数在不同网络层中表现最优:在MNIST中,ReLU在顶层占主导地位,而tanh和反绝对值函数在底层更优。
  • 在ISOLET数据集中,早期层未表现出对任一激活函数的明显偏好,但最终层选择了tanh,表明网络具备数据集特定的自适应能力。
  • 在残差网络中,第二类ReLU变体(具有不同截距)表现最佳,与ReLU在残差连接中的作用一致。
  • 在STL-10数据集的自编码器中,包含绝对值类函数且使用权重重用的集成方法实现了有效的特征重构,表明该方法不仅适用于分类任务,还具备良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。