Skip to main content
QUICK REVIEW

[论文解读] Exploring Feature Reuse in DenseNet Architectures

Andy Hess|arXiv (Cornell University)|Jun 5, 2018
Advanced Neural Network Applications参考文献 5被引用 3
一句话总结

该论文提出WinDenseNet,一种DenseNet的变体,其将每层的连接限制为仅与前N层相连(局部密集连接),从而在减少参数量和训练时间的同时,通过更高效的特征重用提升准确率。关键发现是,在固定容量下,较低连接度但更高增长速率的设置优于完整的DenseNet,尤其在深层块中表现更优。

ABSTRACT

Densely Connected Convolutional Networks (DenseNets) have been shown to achieve state-of-the-art results on image classification tasks while using fewer parameters and computation than competing methods. Since each layer in this architecture has full access to the feature maps of all previous layers, the network is freed from the burden of having to relearn previously useful features, thus alleviating issues with vanishing gradients. In this work we explore the question: To what extent is it necessary to connect to all previous layers in order to reap the benefits of feature reuse? To this end, we introduce the notion of local dense connectivity and present evidence that less connectivity, allowing for increased growth rate at a fixed network capacity, can achieve a more efficient reuse of features and lead to higher accuracy in dense architectures.

研究动机与目标

  • 探究DenseNets中的完整密集连接是否对性能提升是必要的。
  • 探讨深度网络中连接范围与表征能力(增长速率)之间的权衡。
  • 确定局部密集连接是否能实现比完整DenseNet更高的参数效率和更高的准确率。
  • 分析不同连接窗口大小下特征重用模式的差异。
  • 提供证据表明,并非所有先前的特征在深度网络中都具有同等的重用价值。

提出的方法

  • 提出一种新架构WinDenseNet-N,其中密集块中的每一层仅与前N层连接,形成‘密集窗口’的连接模式。
  • 以窗口大小N参数化网络,当N = L+1时,对应于L层的完整DenseNet。
  • 保持标准DenseNet组件:批量归一化、ReLU、3x3卷积以及带池化的过渡层用于下采样。
  • 使用与原始DenseNet-40相同的超参数进行训练(SGD,批量大小64,动量0.9,权重衰减1e-4,dropout 80%)。
  • 通过计算不同窗口大小下前序层特征图的归一化依赖度分数,可视化特征重用情况。
  • 分析密集块中滤波器强度与重用模式,以评估连接方式对特征利用的影响。

实验结果

研究问题

  • RQ1DenseNets中的完整密集连接是否对实现高性能是必要的?
  • RQ2将连接减少到仅与前序层的局部窗口,是否能提升参数效率和准确率?
  • RQ3密集窗口大小的选择如何影响不同密集块中的特征重用模式?
  • RQ4在固定模型容量下,是否在有限连接下采用更高增长速率能优于在完整连接下采用更低增长速率?
  • RQ5在局部连接的密集网络中,早期还是后期的特征图更有效地被重用?

主要发现

  • WinDenseNet在窗口大小为5时,在CIFAR-10上达到94.9%的top-1准确率,优于相同参数量下的DenseNet-40(94.8%)。
  • 将密集连接从完整连接(N=13)减少到较小值(如N=5)显著减少了参数量和训练时间,且准确率下降可忽略。
  • 具有较小密集窗口大小(如N=2)的网络表现出对最早可获得特征图的强烈偏好,尤其在早期密集块中。
  • 随着窗口大小增加,特征重用逐渐转向邻近层,深层块(如第3个块)对远距离特征的重用逐渐减少。
  • 随着窗口大小增大,各块间平均滤波器强度下降,表明深层网络对长距离特征重用的依赖性降低。
  • 结果表明,将容量分配给更高的增长速率而非完整连接,能更有效地利用参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。