Skip to main content
QUICK REVIEW

[论文解读] Selective Feature Connection Mechanism: Concatenating Multi-layer CNN Features with a Feature Selector

Chen Du, Chunheng Wang|arXiv (Cornell University)|Nov 15, 2018
Advanced Neural Network Applications参考文献 55被引用 4
一句话总结

本文提出了一种轻量级、端到端可训练的模块——选择性特征连接机制(SFCM),该模块利用由高层特征生成的特征选择器,选择性地融合低层和高层CNN特征。通过模仿人类视觉注意机制,SFCM在图像分类、场景文本检测和图像到图像翻译任务中均实现了极低计算开销下的性能提升,并持续优于基线模型。

ABSTRACT

Different layers of deep convolutional neural networks(CNNs) can encode different-level information. High-layer features always contain more semantic information, and low-layer features contain more detail information. However, low-layer features suffer from the background clutter and semantic ambiguity. During visual recognition, the feature combination of the low-layer and high-level features plays an important role in context modulation. If directly combining the high-layer and low-layer features, the background clutter and semantic ambiguity may be caused due to the introduction of detailed information. In this paper, we propose a general network architecture to concatenate CNN features of different layers in a simple and effective way, called Selective Feature Connection Mechanism (SFCM). Low-level features are selectively linked to high-level features with a feature selector which is generated by high-level features. The proposed connection mechanism can effectively overcome the above-mentioned drawbacks. We demonstrate the effectiveness, superiority, and universal applicability of this method on multiple challenging computer vision tasks, including image classification, scene text detection, and image-to-image translation.

研究动机与目标

  • 为解决深度CNN中低层细节特征与高层语义特征融合时因背景杂乱而引入噪声和歧义的问题。
  • 开发一种通用、轻量级的模块,实现多层CNN特征的选择性融合,同时不降低语义表征能力。
  • 通过注意力机制有效调控特征流,提升图像分类、场景文本检测和图像到图像翻译等多样化计算机视觉任务的性能。
  • 设计一种与生物视觉注意机制一致的机制,即高层语义引导相关低层特征的选择。

提出的方法

  • SFCM通过高层特征生成的特征选择器,动态控制哪些低层特征被拼接,实现基于注意力的特征融合。
  • 该方法支持两种连接模式:直接连接与残差连接,二者均可微分并通过标准反向传播进行训练。
  • 特征选择器被实现为可学习的注意力图,根据高层上下文信息关注低层特征图中的空间位置。
  • 该机制即插即用,可轻松集成到U-Net、EAST和pix2pix等现有CNN架构中,无需对网络结构进行大规模修改。
  • 特征选择器与主干网络端到端联合训练,采用标准优化方法(如Adam),参数和计算开销极低。
  • 该方法充分利用了低层特征(细节)与高层特征(语义)的互补优势,减少了无关低层信号带来的噪声影响。

实验结果

研究问题

  • RQ1可学习的、由高层驱动的特征选择器是否能提升视觉识别任务中多层级CNN特征的融合效果?
  • RQ2与直接拼接多尺度特征相比,选择性特征连接在准确率和鲁棒性方面是否表现更优?
  • RQ3SFCM是否可普遍应用于多样化计算机视觉任务,包括目标检测与图像翻译?
  • RQ4SFCM在复杂场景中检测小尺寸或多方向文本方面,对模型性能有何影响?
  • RQ5在图像到图像翻译任务中,SFCM在多大程度上提升了生成图像的质量,特别是对细节的保留能力?

主要发现

  • 在ICDAR 2015场景文本检测基准上,采用SFCM的EAST模型F-score达到0.8254,显著优于基线模型,精度与召回率均大幅提升。
  • 在COCO-Text数据集上,SFCM增强的EAST模型F-score达到0.4554,展现出对多方向及小尺寸文本实例更强的检测能力。
  • 在Cityscapes数据集上的图像到图像翻译任务中,采用SFCM的cGAN模型像素级准确率达到0.71,较基线的0.66有所提升,且生成图像中细节保留更佳。
  • 定性结果表明,SFCM生成的图像边缘更清晰,结构细节更准确,尤其在城市景观等复杂场景中表现突出。
  • SFCM在所有评估任务中均持续提升性能,验证了其在多样化深度学习流水线中的通用性与有效性。
  • 该方法引入的参数与计算开销极低,适用于资源受限环境的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。