Skip to main content
QUICK REVIEW

[论文解读] DeepLABNet: End-to-end Learning of Deep Radial Basis Networks with Fully Learnable Basis Functions

Andrew Hryniowski, Alexander Wong|arXiv (Cornell University)|Nov 20, 2019
Neural Networks and Applications被引用 7
一句话总结

DeepLABNet 提出了一种端到端可训练的深层径向基函数(RBF)网络,其基函数完全可学习,实现了分层的、自适应的非线性激活。通过解耦通道依赖关系,采用多调和RBF,并施加有针对性的正则化,该方法在CIFAR-10和CIFAR-100上实现了最先进性能,相较于基于ReLU的ResNet,准确率最高提升5.7%,同时保持了相近的FLOPs和参数量。

ABSTRACT

From fully connected neural networks to convolutional neural networks, the learned parameters within a neural network have been primarily relegated to the linear parameters (e.g., convolutional filters). The non-linear functions (e.g., activation functions) have largely remained, with few exceptions in recent years, parameter-less, static throughout training, and seen limited variation in design. Largely ignored by the deep learning community, radial basis function (RBF) networks provide an interesting mechanism for learning more complex non-linear activation functions in addition to the linear parameters in a network. However, the interest in RBF networks has waned over time due to the difficulty of integrating RBFs into more complex deep neural network architectures in a tractable and stable manner. In this work, we present a novel approach that enables end-to-end learning of deep RBF networks with fully learnable activation basis functions in an automatic and tractable manner. We demonstrate that our approach for enabling the use of learnable activation basis functions in deep neural networks, which we will refer to as DeepLABNet, is an effective tool for automated activation function learning within complex network architectures.

研究动机与目标

  • 通过实现径向基函数(RBF)激活的端到端学习,克服深度神经网络中静态、不可学习激活函数的局限性。
  • 通过引入一种新颖且稳定的训练框架,解决将RBF网络整合到深度架构中所导致的历史性不稳定与不可行性问题。
  • 探索可学习RBF作为深度学习中固定激活函数的替代方案,特别是在分层网络设计中的潜力。
  • 评估可学习RBF在不同模型规模和数据集上的性能,与标准的ReLU基网络进行比较。
  • 证明可学习RBF在小型模型和更复杂数据集上可实现高于标准ReLU网络和单层RBF网络的准确率。

提出的方法

  • 在子RBF网络中解耦通道间依赖关系,以提升训练稳定性和可扩展性。
  • 采用多调和径向基函数作为核心非线性激活单元,实现灵活且可学习的非线性变换。
  • 引入有针对性的正则化和初始化技术,以缓解训练不稳定性并降低陷入局部极小值的风险。
  • 支持通过整个网络(包括RBF中心和核系数)进行端到端反向传播,实现基函数的完整参数化。
  • 通过RBF输出的线性组合(y = λh)生成最终预测,其中λ和RBF中心(c_p)在训练过程中联合优化。
  • 采用改进的训练策略,结合学习率调度和早停法,以控制过拟合和性能方差。

实验结果

研究问题

  • RQ1完全可学习的径向基函数能否被有效集成到深度神经网络架构中,以实现端到端训练?
  • RQ2在CIFAR-10和CIFAR-100上,DeepLABNet在不同模型规模下的性能与标准ReLU基ResNet相比如何?
  • RQ3与固定激活函数相比,使用可学习RBF在训练时间、过拟合和性能方差方面存在哪些权衡?
  • RQ4DeepLABNet在复杂、分层任务中是否实现了优于单层RBF网络或标准ReLU网络的表征学习能力?
  • RQ5DeepLABNet能否在减小模型尺寸的同时保持高准确率,从而适用于边缘设备部署?

主要发现

  • 在CIFAR-100上,DeepLABNet相较于ReLU基ResNet-8实现了5.7%的准确率提升,表明在小型模型和复杂数据集上具有显著优势。
  • 在CIFAR-10上,DeepLABNet使用ResNet-50达到91.9%的准确率,较ReLU基线高出0.3%,且仅消耗2.31亿FLOPs。
  • 对于ResNet-32,DeepLABNet在CIFAR-10上达到91.6%的准确率,在CIFAR-100上达到67.8%,性能与甚至超过更大的ReLU基ResNet-50模型。
  • 在Nvidia GTX 1080 Ti上,ResNet-8的训练时间增加50%,ResNet-50的训练时间增加150%,表明存在训练效率的权衡。
  • 随着模型增大,DeepLABNet在较长训练周期下表现出更高的过拟合和性能方差,尤其在高学习率下更为明显。
  • 尽管方差较高,DeepLABNet在所有模型规模和数据集上始终实现高于ReLU基线的平均性能,验证了其在自动激活函数学习中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。