Skip to main content
QUICK REVIEW

[论文解读] Characterizing signal propagation to close the performance gap in unnormalized ResNets

Andrew Brock, Soham De|arXiv (Cornell University)|Jan 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 72被引用 21
一句话总结

本文提出一种无需归一化层的深度残差网络架构,无需使用批量归一化(BatchNorm)或其他归一化层即可在 ImageNet 上实现最先进性能。通过引入信号传播图(Signal Propagation Plots)和加权标准化(Scaled Weight Standardization),该方法稳定了 ReLU/Swish 网络中的信号增长,使深度网络(最高达 288 层)在不同计算量预算(FLOP)下均能匹配或超越使用 BatchNorm 的 ResNet 准确率。

ABSTRACT

Batch Normalization is a key component in almost all state-of-the-art image classifiers, but it also introduces practical challenges: it breaks the independence between training examples within a batch, can incur compute and memory overhead, and often results in unexpected bugs. Building on recent theoretical analyses of deep ResNets at initialization, we propose a simple set of analysis tools to characterize signal propagation on the forward pass, and leverage these tools to design highly performant ResNets without activation normalization layers. Crucial to our success is an adapted version of the recently proposed Weight Standardization. Our analysis tools show how this technique preserves the signal in networks with ReLU or Swish activation functions by ensuring that the per-channel activation means do not grow with depth. Across a range of FLOP budgets, our networks attain performance competitive with the state-of-the-art EfficientNets on ImageNet.

研究动机与目标

  • 在不使用归一化层的前提下,弥合未归一化残差网络与批量归一化残差网络之间的性能差距。
  • 识别并解决未归一化残差网络中因 ReLU/Swish 非线性导致激活均值随深度增长而引发的失效模式。
  • 为训练深层、无需归一化的残差网络提供一种通用方法,使其在 ImageNet 上达到或超越当前最先进性能。
  • 展示该方法在下游任务(如语义分割和深度估计)中的可迁移性。

提出的方法

  • 引入信号传播图(SPPs)以可视化和分析深度残差网络在初始化阶段的信号动态。
  • 发现使用高斯权重的 ReLU/Swish 网络中,激活均值随深度增长是导致未归一化残差网络性能下降的关键原因。
  • 提出加权标准化(Scaled Weight Standardization)——一种改进的权重标准化方法,通过防止信号均值随深度增长来稳定信号。
  • 将加权标准化应用于标准 ResNets 和 RegNets,并结合复合缩放(compound scaling),构建无需归一化的模型。
  • 采用将残差分支初始化为零,并使用可学习标量以在初始化时保持恒等映射偏置。
  • 在 ImageNet、Pascal VOC 语义分割和 NYU Depth v2 上验证性能,采用标准训练协议,无需额外正则化。

实验结果

研究问题

  • RQ1为何在具备深度训练能力的前提下,使用 ReLU 或 Swish 激活函数的未归一化残差网络仍会显著低于批量归一化模型的性能?
  • RQ2如何在初始化阶段诊断并控制未归一化残差网络中的信号传播,以实现与 BN 模型相当的性能?
  • RQ3加权标准化是否能有效稳定激活均值的增长,从而实现在无归一化层情况下的高精度训练?
  • RQ4在不同架构和计算量预算下,无需归一化的残差网络在多大程度上可实现最先进性能?
  • RQ5无需归一化的模型在语义分割和深度估计等下游视觉任务中具有多大程度的可迁移性?

主要发现

  • 加权标准化成功防止了深层 ReLU/Swish 网络中激活均值的增长,解决了未归一化残差网络中的关键失效模式。
  • 所提出的无需归一化的残差网络在多种 FLOP 预算下,其在 ImageNet 上的测试准确率与当前最先进模型(如 EfficientNets)相当。
  • 在 ImageNet 上,最佳的无需归一化的 ResNet-288 模型达到 84.6% 的 top-1 准确率,与 BN-ResNet 基线模型持平或更优。
  • 在 Pascal VOC 语义分割任务中,无需归一化的残差网络在所有深度变体下,mIoU 分数与对应 BN 模型相差不超过 1%。
  • 在 NYU Depth v2 数据集上,无需归一化的模型在关键指标(如 % <1.25 错误率和相对误差)上与 BN-ResNet 表现相当或略优。
  • 该方法可推广至 RegNet 架构,实现复合缩放的无需归一化模型,其性能达到或超越当前 ImageNet 的最先进水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。