Skip to main content
QUICK REVIEW

[论文解读] Funnel Activation for Visual Recognition

Ningning Ma, Xiangyu Zhang|arXiv (Cornell University)|Jul 23, 2020
Advanced Neural Network Applications参考文献 46被引用 14
一句话总结

本文提出了一种新型的2D空间感知激活函数——Funnel激活(FReLU),通过小型卷积滤波器引入可学习的空间条件,扩展了ReLU和PReLU,实现了像素级特征建模,且计算开销极低。FReLU在ImageNet、COCO目标检测和Cityscapes语义分割任务上均达到最先进性能,优于ReLU和PReLU,且与ResNet、MobileNet等现有架构高度兼容。

ABSTRACT

We present a conceptually simple but effective funnel activation for image recognition tasks, called Funnel activation (FReLU), that extends ReLU and PReLU to a 2D activation by adding a negligible overhead of spatial condition. The forms of ReLU and PReLU are y = max(x, 0) and y = max(x, px), respectively, while FReLU is in the form of y = max(x,T(x)), where T(x) is the 2D spatial condition. Moreover, the spatial condition achieves a pixel-wise modeling capacity in a simple way, capturing complicated visual layouts with regular convolutions. We conduct experiments on ImageNet, COCO detection, and semantic segmentation tasks, showing great improvements and robustness of FReLU in the visual recognition tasks. Code is available at https://github.com/megvii-model/FunnelAct.

研究动机与目标

  • 解决标量激活函数在捕捉视觉识别任务空间上下文方面的局限性。
  • 设计一种简单而有效的激活机制,利用空间上下文增强特征表示,同时不增加模型复杂度。
  • 仅通过修改激活函数,提升密集预测任务(如分割、检测)和稀疏任务(如分类)的性能。
  • 展示与现有注意力机制(如SENet)的兼容性与协同效应。

提出的方法

  • FReLU用可学习的2D空间条件替代ReLU中的标量阈值,定义为 y = max(x, T(x)),其中 T(x) 是一个小的卷积特征图。
  • 空间条件 T(x) 通过在输入特征图上应用1×1或小卷积核(如3×3、5×5)卷积计算,实现局部空间上下文建模。
  • 该方法计算开销极低,每层仅增加少量FLOPs。
  • FReLU应用于卷积层之后,尤其适用于残差块中的1×1和3×3卷积之后,以增强特征表示。
  • 空间条件通过端到端训练进行学习,使网络能够自适应地建模复杂的视觉布局。
  • 该方法在多种架构(ResNet-50、MobileNet、ShuffleNetV2)和任务(分类、检测、分割)上进行了评估。

实验结果

研究问题

  • RQ1在激活函数中引入简单且可学习的空间条件,是否能显著提升视觉识别任务的性能?
  • RQ2像FReLU这样的2D空间感知激活函数,是否在稀疏和密集预测任务中均优于标准的标量激活函数(如ReLU、PReLU)?
  • RQ3当与SENet等注意力机制结合时,FReLU的表现如何?
  • RQ4在CNN架构中,FReLU的最佳放置位置是什么?(例如,在1×1卷积后还是3×3卷积后,浅层还是深层阶段?)

主要发现

  • 在ResNet-50上,FReLU将ImageNet的top-1错误率从ReLU的24.0%降低至22.4%,绝对提升1.6%。
  • 在COCO目标检测任务中,使用ResNet-50作为主干网络时,FReLU相比ReLU将mAP提升了1.2%。
  • 在Cityscapes语义分割任务中,FReLU的平均IoU比ReLU高出1.5%,表明其在密集预测任务中具有强大的泛化能力。
  • 单独使用FReLU时,其性能优于SENet;当与SENet结合时,准确率进一步提升至22.1%,显示出极强的兼容性。
  • 最佳性能出现在残差块中1×1和3×3卷积之后均应用FReLU时,ImageNet的top-1错误率为22.4%。
  • 在ResNet-50的早期阶段(第2–4阶段)应用FReLU带来的性能增益大于深层阶段,完整配置实现了最低的22.4%错误率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。