[论文解读] Dynamic Optimization of Neural Network Structures Using Probabilistic Modeling
本文提出了一种概率框架,通过使用参数化分布(特别是伯努利分布)将网络结构组件(如连接、激活类型、层)建模为随机变量,实现对神经网络结构的动态、可微分优化,从而在梯度优化过程中联合学习权重和结构参数。该方法在保持准确率的前提下显著减少了参数量,例如在CIFAR-100上对DenseNet进行优化时,参数量减少了10%。
Deep neural networks (DNNs) are powerful machine learning models and have succeeded in various artificial intelligence tasks. Although various architectures and modules for the DNNs have been proposed, selecting and designing the appropriate network structure for a target problem is a challenging task. In this paper, we propose a method to simultaneously optimize the network structure and weight parameters during neural network training. We consider a probability distribution that generates network structures, and optimize the parameters of the distribution instead of directly optimizing the network structure. The proposed method can apply to the various network structure optimization problems under the same framework. We apply the proposed method to several structure optimization problems such as selection of layers, selection of unit types, and selection of connections using the MNIST, CIFAR-10, and CIFAR-100 datasets. The experimental results show that the proposed method can find the appropriate and competitive network structures.
研究动机与目标
- 为解决选择最优深度神经网络(DNN)架构(包括层深度、单元类型和连接方式)的挑战,这些通常为人工操作且耗时。
- 克服静态超参数优化(如贝叶斯优化)效率低下的问题,后者需要在多个配置下重复训练。
- 开发一种动态优化方法,在单个训练循环内同时学习网络权重和结构组件,提升计算效率。
- 通过使用非可微结构选择的概率建模,超越现有可微架构搜索方法对可微结构参数的依赖,提升灵活性。
- 在多种结构优化任务中(包括连接剪枝、激活函数选择和层跳跃优化)展示该方法的有效性。
提出的方法
- 该方法使用参数化概率分布(特别是伯努利分布)将网络结构参数(如连接、激活函数)建模为随机变量,以表示二元决策(如连接是否存在或单元是否丢弃)。
- 目标函数定义为网络结构分布上的期望损失,从而实现对网络权重和分布参数的梯度优化。
- 使用随机梯度下降优化分布参数(如伯努利概率),实现端到端训练,使权重和结构概率同步更新。
- 该框架支持在统一的概率公式下联合优化多个结构组件(如连接、激活函数和层跳跃)。
- 该方法使用重参数化技术,实现对随机结构参数的梯度反向传播,即使底层结构不可微,也能实现可微训练。
- 该方法具有通用性和可扩展性:尽管本文聚焦于伯努利分布,但可扩展至其他指数族分布(如多项分布),以支持更复杂的结构选择。
实验结果
研究问题
- RQ1是否能够通过统一的概率框架,在训练过程中动态地同时优化多种神经网络结构组件(如连接、激活函数和层跳跃)?
- RQ2与静态优化方法(如贝叶斯优化)相比,该方法在准确率和训练效率方面表现如何?
- RQ3该方法在不损失准确率的前提下,能在多大程度上通过自动剪枝连接或单元来降低模型复杂度(如参数数量)?
- RQ4该方法能否发现非标准但有效的网络架构,这些架构难以由人工专家设计?
- RQ5当在不同数据集和网络类型(如DenseNets)上优化结构超参数时,该方法的泛化能力如何?
主要发现
- 所提方法在CIFAR-10和CIFAR-100数据集上取得了与标准DenseNet及最先进静态架构搜索方法相当的测试误差率。
- 在CIFAR-100上,该方法将连接数减少了约70个,同时保持性能不变,总权重参数减少了10%。
- 连接的所学习伯努利参数主要集中在0.0或1.0附近,表明冗余连接被高概率有效剪枝。
- 该方法表现出计算效率优势,尽管最终准确率可能略低,但在训练时间上优于贝叶斯优化等静态优化技术。
- 该框架成功实现了对多个结构组件的联合优化,包括层跳跃、激活函数混合率和连接,展现出在不同任务中的灵活性和泛化能力。
- 使用采样结构的随机预测略优于使用期望结构的确定性推理,但差异不显著,表明期望结构具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。