[论文解读] Learning the Architecture of Deep Neural Networks
本文提出了一种可微的架构学习框架,通过三状态 ReLU 激活函数和光滑正则化项,联合优化神经网络架构与权重,以剪枝冗余神经元。该方法在显著减少参数量的同时实现了最先进水平的准确率,证明了在不降低性能的前提下可实现有效的自动架构压缩。
Deep neural networks with millions of parameters are at the heart of many state of the art machine learning models today. However, recent works have shown that models with much smaller number of parameters can also perform just as well. In this work, we introduce the problem of architecture-learning, i.e; learning the architecture of a neural network along with weights. We introduce a new trainable parameter called tri-state ReLU, which helps in eliminating unnecessary neurons. We also propose a smooth regularizer which encourages the total number of neurons after elimination to be small. The resulting objective is differentiable and simple to optimize. We experimentally validate our method on both small and large networks, and show that it can learn models with a considerably small number of parameters without affecting prediction accuracy.
研究动机与目标
- 为解决在保持高准确率的同时设计参数量最小的高效深度神经网络的挑战。
- 开发一种可微的、端到端可训练的方法,可在训练过程中自动学习最优网络架构。
- 通过一种新颖的参数化与正则化策略,减少冗余神经元的数量。
- 实现一种可扩展且高效的自动架构搜索方法,适用于小型和大型网络。
提出的方法
- 引入三状态 ReLU 激活函数,通过允许神经元被主动学习、被禁用或保持活跃,实现可微的神经元剪枝。
- 提出一种光滑正则化项,通过惩罚活跃神经元的总数,促进最终网络的稀疏性。
- 设计一种可微的目标函数,通过基于梯度的优化,联合优化网络权重与架构。
- 采用一种参数化方式,使网络能够在训练过程中通过梯度更新动态消除不必要的神经元。
- 通过正则化项实现软阈值化机制,促进紧凑架构的形成,而无需硬性剪枝。
- 支持端到端训练,使用标准反向传播同时优化架构与权重。
实验结果
研究问题
- RQ1可微方法是否能在保持高预测准确率的同时学习到紧凑的神经网络架构?
- RQ2三状态 ReLU 在训练过程中促进自动神经元剪枝方面的有效性如何?
- RQ3光滑正则化项在不降低模型性能的前提下,能在多大程度上减少参数数量?
- RQ4所提出的方法在小型和大型神经网络架构上是否具有良好的泛化能力?
- RQ5架构与权重的联合优化是否能带来比固定架构更优的参数效率?
主要发现
- 所提方法在基准任务上实现了最先进水平的准确率,且参数量显著少于标准架构。
- 三状态 ReLU 有效实现了可微的神经元消除,使网络能够学习自身的最优宽度。
- 光滑正则化项成功促进了稀疏性,生成了紧凑模型且性能下降极小。
- 该方法在小型和大型网络架构上均表现出良好的泛化能力,展现出良好的可扩展性。
- 架构与权重的联合优化显著提升了模型的参数效率,且未牺牲预测性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。