Skip to main content
QUICK REVIEW

[论文解读] SORT: Second-Order Response Transform for Visual Recognition

Yan Wang, Lingxi Xie|arXiv (Cornell University)|Mar 20, 2017
Domain Adaptation and Few-Shot Learning参考文献 34被引用 4
一句话总结

本文提出二阶响应变换(SORT),一种轻量级模块,通过在双分支特征的线性求和基础上增加逐元素乘积操作,增强深度神经网络。通过引入二阶交互,SORT提升了跨分支信息流动与非线性,使在CIFAR和ImageNet基准上实现一致的精度提升,且推理开销低于5%。

ABSTRACT

In this paper, we reveal the importance and benefits of introducing second-order operations into deep neural networks. We propose a novel approach named Second-Order Response Transform (SORT), which appends element-wise product transform to the linear sum of a two-branch network module. A direct advantage of SORT is to facilitate cross-branch response propagation, so that each branch can update its weights based on the current status of the other branch. Moreover, SORT augments the family of transform operations and increases the nonlinearity of the network, making it possible to learn flexible functions to fit the complicated distribution of feature space. SORT can be applied to a wide range of network architectures, including a branched variant of a chain-styled network and a residual network, with very light-weighted modifications. We observe consistent accuracy gain on both small (CIFAR10, CIFAR100 and SVHN) and big (ILSVRC2012) datasets. In addition, SORT is very efficient, as the extra computation overhead is less than 5%.

研究动机与目标

  • 解决深度网络中线性融合的表征能力有限的问题,该问题限制了其对复杂特征分布的建模能力。
  • 克服标准残差网络和多分支网络仅依赖线性求和进行特征融合的局限性。
  • 开发一种简单而有效的模块,以较低计算成本增强非线性和跨分支信息流动。
  • 在小规模和大规模视觉识别任务中,实现对链式结构和残差网络等多种架构的一致性能提升。
  • 展示SORT增强特征在下游任务(如Caltech256上的迁移学习)中的可迁移性。

提出的方法

  • 提出一种双分支网络模块,通过二阶操作融合输出:$\mathbf{F}_1(\mathbf{x}) + \mathbf{F}_2(\mathbf{x}) + \mathbf{F}_1(\mathbf{x}) \odot \mathbf{F}_2(\mathbf{x})$,结合线性求和与逐元素乘积。
  • 通过将残差块的恒等快捷连接修改为$\mathbf{x} + \mathbf{F}(\mathbf{x}) + \sqrt{\mathbf{x} \odot \mathbf{F}(\mathbf{x})}$,将SORT应用于残差块,引入非线性同时保持残差学习。
  • 引入跨分支响应传播:在反向传播过程中,每个分支根据另一分支的当前状态,通过乘积项更新其权重。
  • 通过仅添加逐元素运算确保计算效率,实现额外计算量低于5%,且无额外内存消耗。
  • 将SORT集成到多种架构中,包括AlexNet和ResNet的分支变体,仅需极少的架构修改。
  • 在CIFAR10、CIFAR100、SVHN和ILSVRC2012上使用标准训练协议和评估指标,验证其在不同数据集和网络深度下的性能。

实验结果

研究问题

  • RQ1引入如逐元素乘积等二阶操作,是否能超越线性融合,提升深度神经网络的表征能力?
  • RQ2添加二阶变换是否能在前向和反向传播过程中增强跨分支信息流动?
  • RQ3SORT能否以较低计算成本高效应用于链式结构网络和残差网络等多种架构?
  • RQ4SORT带来的非线性增强是否能在小规模(CIFAR)和大规模(ImageNet)数据集上带来一致的精度提升?
  • RQ5使用SORT学习的特征在外部数据集(如Caltech256)的迁移学习场景中,其泛化能力如何?

主要发现

  • 在CIFAR10上,SORT将分支AlexNet变体的top-1错误率从36.71%降低至35.99%,相对提升1.96%。
  • 在CIFAR100上,SORT将top-1错误率从14.77%降低至14.46%,相比基线实现2.10%的相对降低。
  • 在ILSVRC2012上,SORT将ResNet-18的top-1错误率从34.50%降低至32.37%,相对提升6.17%;在ResNetT-50上,从23.82%降至23.10%。
  • 该方法在4-GPU机器上引入的额外计算时间低于5%,且无额外内存消耗,证实其高效性。
  • 在Caltech256上的迁移学习实验表明,SORT增强模型的pool-5层特征达到74.88%的准确率,优于基线AlexNet*(74.20%)和AlexNet(69.19%)。
  • 学习曲线显示,尽管SORT在某些情况下可能略微减缓收敛速度,但其在各类架构中均能一致提升最终泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。