Skip to main content
QUICK REVIEW

[论文解读] DelugeNets: Deep Networks with Efficient and Flexible Cross-layer Information Inflows

Jason Kuen, Xiangfei Kong|arXiv (Cornell University)|Nov 17, 2016
Advanced Neural Network Applications参考文献 38被引用 4
一句话总结

DelugeNets 提出了一种新颖的深度神经网络架构,通过可学习的跨层逐通道卷积层,实现了高效、灵活且大规模的跨层信息流动。这些层独立于空间和通道维度处理跨层相关性,使 DelugeNets 在 CIFAR-10、CIFAR-100 和 ImageNet 上实现了最先进(SOTA)的准确率,同时相比 ResNets 和 DenseNets 显著降低了 FLOPs 和参数量。

ABSTRACT

Deluge Networks (DelugeNets) are deep neural networks which efficiently facilitate massive cross-layer information inflows from preceding layers to succeeding layers. The connections between layers in DelugeNets are established through cross-layer depthwise convolutional layers with learnable filters, acting as a flexible yet efficient selection mechanism. DelugeNets can propagate information across many layers with greater flexibility and utilize network parameters more effectively compared to ResNets, whilst being more efficient than DenseNets. Remarkably, a DelugeNet model with just model complexity of 4.31 GigaFLOPs and 20.2M network parameters, achieve classification errors of 3.76% and 19.02% on CIFAR-10 and CIFAR-100 dataset respectively. Moreover, DelugeNet-122 performs competitively to ResNet-200 on ImageNet dataset, despite costing merely half of the computations needed by the latter.

研究动机与目标

  • 解决 ResNets 中信息流动僵化、无选择性的问题,即所有前序层输出均被简单求和而未进行优先级处理。
  • 克服 DenseNets 中计算和参数成本过高的问题,其通过连接所有前序层输出并依赖高成本的卷积操作。
  • 在不牺牲模型效率或表征能力的前提下,实现在深层网络中大规模且有选择性的跨层信息流入。
  • 设计一种参数高效的架构,在保持复合层输出宽度一致(如 16–64 通道)的同时支持丰富的跨层连接。
  • 在图像分类基准上实现具有竞争力的性能,同时相比现有深层网络显著降低计算复杂度和内存占用。

提出的方法

  • 引入仅处理深度/跨层维度的跨层逐通道卷积层,将其与空间和通道维度解耦。
  • 在跨层逐通道卷积中使用可学习滤波器,以实现对前序层信息的灵活、自适应选择。
  • 构建保持规则输出宽度(如 16–64 通道)的复合层,确保参数使用的高效性与可扩展性。
  • 设计基于模块的架构,并引入模块转换组件,以有效管理深层堆叠中的分层特征传播。
  • 在 CIFAR 和 ImageNet 数据集上应用标准训练协议(SGD 搭配 Nesterov 动量、权重衰减、余弦学习率衰减)。
  • 使用多 GPU 训练与批量拆分技术,高效处理大模型和高分辨率输入。

实验结果

研究问题

  • RQ1深度网络架构是否能在不带来高计算或参数成本的前提下,支持大规模、灵活且高效的跨层信息流动?
  • RQ2通过逐通道卷积实现的可学习跨层连接,在准确率和效率方面,与 ResNets 的固定残差连接或 DenseNets 的连接式连接相比如何?
  • RQ3DelugeNets 在显著降低 FLOPs 和参数量的同时,能在多大程度上保持高性能并维持表征能力?
  • RQ4将跨层相关性学习与空间和通道维度解耦,是否能提升训练稳定性和泛化能力?
  • RQ5在相似的模型复杂度约束下,DelugeNets 是否能超越如 ResNet 和 DenseNet 等最先进模型?

主要发现

  • DelugeNet 在 4.31 GFLOPs 和 20.2M 参数下,CIFAR-10 上达到 3.76% 的 top-1 错误率,CIFAR-100 上为 19.02%,优于标准的 ResNets 和 DenseNets,且复杂度更低。
  • DelugeNet-122 在 ImageNet 上实现 21.53% 的 top-1 错误率,仅需 15.2 GFLOPs,性能与 ResNet-200 相当,但 FLOPs 减半。
  • DelugeNet-92(43.4M 参数,11.8 GFLOPs)在 ImageNet 上优于 ResNet-101 和 ResNet-152,top-1 和 top-5 错误率均更低。
  • 尽管参数量高于某些 ResNets,DelugeNets 仍以显著更低的 FLOPs 实现更高准确率,表明其具有更优的参数效率。
  • DelugeNet-122 在准确率上超越 DenseNet-161,同时模型复杂度相当或更低,证明其高效性与可扩展性。
  • DelugeNet-146 训练时内存占用为 2.8GB(ResNet 为 1.3GB),但仍显著低于 DenseNet-BC 变体(最高达 8.6GB),表现出更高的内存效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。