[论文解读] Refining Architectures of Deep Convolutional Neural Networks
该论文提出了一种针对深度卷积神经网络(CNN)的新型架构优化方法,通过两种操作——层拉伸(增加隐藏单元数)和对称分割(将输入/输出通道分组)——在提升准确率的同时减小模型规模。该方法在SUN Attributes和CAMIT-NSAD数据集上的GoogleNet与VGG-11上应用后,相比基线模型取得了更高的精度,尤其在SUN Attributes数据集上表现更优,同时减少了参数量,表明在某些情况下实现了双赢,而在其他情况下则提供了可行的替代方案。
Deep Convolutional Neural Networks (CNNs) have recently evinced immense success for various image recognition tasks. However, a question of paramount importance is somewhat unanswered in deep learning research - is the selected CNN optimal for the dataset in terms of accuracy and model size? In this paper, we intend to answer this question and introduce a novel strategy that alters the architecture of a given CNN for a specified dataset, to potentially enhance the original accuracy while possibly reducing the model size. We use two operations for architecture refinement, viz. stretching and symmetrical splitting. Our procedure starts with a pre-trained CNN for a given dataset, and optimally decides the stretch and split factors across the network to refine the architecture. We empirically demonstrate the necessity of the two operations. We evaluate our approach on two natural scenes attributes datasets, SUN Attributes and CAMIT-NSAD, with architectures of GoogleNet and VGG-11, that are quite contrasting in their construction. We justify our choice of datasets, and show that they are interestingly distinct from each other, and together pose a challenge to our architectural refinement algorithm. Our results substantiate the usefulness of the proposed method.
研究动机与目标
- 为解决预训练CNN架构在给定数据集上是否在准确率与模型规模方面达到最优这一开放性问题。
- 开发一种通过调整层宽与连接模式来优化CNN架构的策略,以提升性能。
- 为希望在不从头训练的情况下提升准确率或减小模型规模的用户提供一种实用替代方案。
- 在具有对比性CNN架构的多样化且具有挑战性的数据集上,评估架构优化的有效性。
提出的方法
- 该方法从一个预训练的CNN开始,应用两种操作:拉伸(增加某一层的隐藏单元数)和对称分割(将输入与输出通道划分为K个相等组,并对相应组进行连接)。
- 拉伸用于在类别分离性能不佳的层中提升表征能力,而对称分割通过引入分组卷积来减少参数量。
- 算法基于每个卷积层的类别分离性能,利用验证集指导决策,贪婪地选择每层最优的拉伸与分割因子。
- 该方法仅应用于卷积层,保持原始网络的深度与整体结构不变。
- 采用precision@k作为评估指标,其中k设置为测试集中每张图像的正样本标签最大数量。
- 训练使用Caffe框架,采用自适应学习率调度,并训练100个周期;优化过程在预训练后执行,无需对整个网络重新训练。
实验结果
研究问题
- RQ1通过拉伸与对称分割进行架构优化,是否能在不增加模型规模的前提下提升预训练CNN在给定数据集上的准确率?
- RQ2拉伸与分割的组合相较于单独使用任一操作,在性能提升方面表现如何?
- RQ3所提出的方法是否在准确率与模型规模之间实现了优于现有稀疏化基线的更好权衡?
- RQ4为何该方法在某些数据集(如SUN Attributes)上能提升精度,而在其他数据集(如CAMIT-NSAD)上则不能?
- RQ5当特定类别信息在多个层中编码时,贪婪的、逐层的优化策略是否能有效优化特征表示?
主要发现
- 在SUN Attributes数据集上,所提方法在准确率上优于所有基线模型与稀疏化方法,同时显著减小了模型规模,实现了双赢结果。
- 在SUN Attributes数据集上,针对VGG-11与GoogleNet,该方法在减少参数量的同时提升了准确率,尤其在卷积层中效果显著。
- 拉伸与对称分割的组合优于单独使用任一操作,表明在架构优化中存在协同增益。
- 在CAMIT-NSAD数据集上,该方法虽略微降低了准确率,但显著减小了模型规模,且最终模型在准确率上仍优于稀疏化基线方法。
- 该算法的贪婪特性可能限制其在具有复杂多层特征编码(如CAMIT-NSAD中的属性-名词对)的数据集上的性能,此时跨层联合优化更为关键。
- 结果表明,架构优化是一种可行且与稀疏化互补的策略,尤其当用户更关注准确率与模型效率时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。