[论文解读] Do Normalization Layers in a Deep ConvNet Really Need to Be Distinct?
本文研究了深度卷积神经网络中不同层是否应使用不同的归一化方法,提出了一种可切换归一化(SN)机制,该机制可为每层学习选择批量归一化、实例归一化和层归一化中的一种。实验结果表明,允许各层自主选择归一化方法可提升在ImageNet、COCO、Cityscapes和ADE20K上的模型性能与泛化能力,且选择主要受网络深度和批量大小影响,而非优化设置。
Yes, they do. This work investigates a perspective for deep learning: whether different normalization layers in a ConvNet require different normalizers. This is the first step towards understanding this phenomenon. We allow each convolutional layer to be stacked before a switchable normalization (SN) that learns to choose a normalizer from a pool of normalization methods. Through systematic experiments in ImageNet, COCO, Cityscapes, and ADE20K, we answer three questions: (a) Is it useful to allow each normalization layer to select its own normalizer? (b) What impacts the choices of normalizers? (c) Do different tasks and datasets prefer different normalizers? Our results suggest that (1) using distinct normalizers improves both learning and generalization of a ConvNet; (2) the choices of normalizers are more related to depth and batch size, but less relevant to parameter initialization, learning rate decay, and solver; (3) different tasks and datasets have different behaviors when learning to select normalizers.
研究动机与目标
- 探究深度网络中不同卷积层是否应使用不同的归一化方法,而非统一采用单一方法。
- 理解影响深度网络中归一化器选择的因素,如深度、批量大小和训练动态。
- 评估学习到的归一化器选择在图像识别、目标检测和语义分割等多样化视觉任务中的泛化能力。
- 提供关于归一化多样性对模型泛化能力和训练稳定性影响的实证洞察。
提出的方法
- 作者采用可切换归一化(SN),通过可学习的重要性比率,为每层学习性地组合多种归一化方法(如BN、IN、LN)的加权平均。
- SN使用来自不同归一化器的均值和方差估计的加权平均对特征进行归一化,权重通过候选归一化器集合上的软最大函数学习得到。
- 该方法应用于每个卷积层之后,使每层在训练过程中可动态选择最合适的归一化器。
- 在ImageNet、COCO、Cityscapes和ADE20K上使用ResNet、Mask R-CNN和DeepLabv2进行实验,以评估性能与选择动态。
- 作者分析了不同网络深度、批量大小和任务下归一化器比率的学习动态,以识别影响因素。
- 发布了一个可复现的代码库,包含预训练和微调模型,以确保实验透明性与可重用性。
实验结果
研究问题
- RQ1是否允许深度卷积网络中每个归一化层从方法池中自主选择归一化器有益?
- RQ2哪些因素对不同层和训练设置下的归一化器选择影响最大?
- RQ3不同计算机视觉任务和数据集是否偏好不同的归一化器配置或动态特性?
- RQ4学习率衰减、优化器类型和权重初始化等训练超参数如何影响归一化器选择?
- RQ5学习到的归一化器选择能否在不同基准上的预训练与微调之间实现泛化?
主要发现
- 为每层使用不同的归一化器可提升在ImageNet、COCO、Cityscapes和ADE20K上的训练收敛速度与泛化性能。
- 归一化器的选择主要受网络深度和批量大小影响,随着批量大小增加,BN比例上升,而IN/LN比例下降。
- BN比例与深度呈反比,而LN比例随深度增加,表明深层网络更受益于LN对空间统计的不变性。
- 归一化器选择对随机权重初始化、学习率衰减策略(如余弦衰减)和优化器类型(如SGD with momentum与RMSProp)的敏感度较低。
- 不同任务(识别、检测与分割)表现出不同的归一化器选择动态,其中检测任务在微调过程中中间层的BN使用量逐渐增加。
- 使用大批量预训练、小批量微调的模型性能表现欠佳,原因在于批量统计不稳定,凸显了预训练与微调阶段批量大小一致的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。