Skip to main content
QUICK REVIEW

[论文解读] YOLOCS: Object Detection based on Dense Channel Compression for Feature Spatial Solidification

Lin Huang, Weisheng Li|arXiv (Cornell University)|May 7, 2023
Advanced Image and Video Retrieval Techniques被引用 4
一句话总结

该论文提出 YOLOCS,一种实时目标检测模型,通过在主干网络中引入用于特征空间固化的密集通道压缩(DCFS),在检测头中采用非对称多级压缩解耦头(ADH),对 YOLOv5 进行改进。通过提升特征纯净度与梯度流动,YOLOCS 在 COCO 上实现了 50.1% 的 SOTA AP,且速度损失极小,优于 YOLOv5 和 YOLOX 在所有模型尺寸下的表现。

ABSTRACT

In this study, we examine the associations between channel features and convolutional kernels during the processes of feature purification and gradient backpropagation, with a focus on the forward and backward propagation within the network. Consequently, we propose a method called Dense Channel Compression for Feature Spatial Solidification. Drawing upon the central concept of this method, we introduce two innovative modules for backbone and head networks: the Dense Channel Compression for Feature Spatial Solidification Structure (DCFS) and the Asymmetric Multi-Level Compression Decoupled Head (ADH). When integrated into the YOLOv5 model, these two modules demonstrate exceptional performance, resulting in a modified model referred to as YOLOCS. Evaluated on the MSCOCO dataset, the large, medium, and small YOLOCS models yield AP of 50.1%, 47.6%, and 42.5%, respectively. Maintaining inference speeds remarkably similar to those of the YOLOv5 model, the large, medium, and small YOLOCS models surpass the YOLOv5 model's AP by 1.1%, 2.3%, and 5.2%, respectively.

研究动机与目标

  • 解决现有 YOLO 主干网络通过加宽/加深提升性能受限的问题,这些网络依赖于 $3\times3$ 卷积。
  • 改善 YOLO 架构在前向与反向传播过程中特征表示的纯净度与梯度流动。
  • 在保持或提升推理速度与检测精度的同时,减少模型参数量与 FLOPs。
  • 设计一种新型主干模块(DCFS)与检测头模块(ADH),实现更优的空间与通道级特征整合。
  • 在 MSCOCO 上实现 SOTA 性能,同时保持与 YOLOv5 相当的实时推理速度。

提出的方法

  • 提出用于特征空间固化的密集通道压缩结构(DCFS),一种新型主干模块,通过密集通道压缩增强特征表示。
  • 提出非对称多级压缩解耦头(ADH),一种检测头网络设计,通过非对称压缩在多尺度上解耦特征学习。
  • 将 DCFS 应用于主干网络与颈部网络,统一全网络架构中的特征空间固化。
  • 利用通道注意力与特征融合机制,强化反向传播过程中的梯度流动并减少噪声。
  • 将 DCFS 与 ADH 集成至 YOLOv5,构建 YOLOCS,在保持推理速度的同时提升精度。
  • 采用标准 YOLO 损失函数与 NMS 进行模型优化,仅聚焦于主干与检测头的结构改进。

实验结果

研究问题

  • RQ1密集通道压缩是否能有效提升基于 YOLO 的目标检测器中特征纯净度与梯度流动?
  • RQ2所提出的 DCFS 模块在精度与效率方面是否优于标准的 CSP 基主干网络?
  • RQ3非对称多级解耦检测头设计能否同时提升小、中、大目标的检测性能?
  • RQ4YOLOCS 在实现高于 YOLOv5 与 YOLOX 的精度的同时,能在多大程度上保持实时推理速度?
  • RQ5DCFS 与 ADH 的结合是否能在 MSCOCO 基准上实现 SOTA 性能?

主要发现

  • YOLOCS-L 在 MSCOCO test-dev 上达到 50.1% AP,比 YOLOv5-L 提升 1.1%,且推理速度几乎相同(V100 上为 90 FPS)。
  • YOLOCS-S 达到 42.6% AP,较 YOLOv5-S 提升 5.2%,较 YOLOX-S 提升 3.0%,延迟仅轻微增加。
  • YOLOCS-M 达到 47.7% AP,较 YOLOv5-M 提升 2.3%,较 YOLOX-M 提升 1.3%,在 V100 上达到 115 FPS。
  • 通过密集通道压缩减少参数量与 FLOPs,实现高效率而不牺牲精度。
  • YOLOCS 在所有模型尺寸下均优于所有对比的 SOTA 模型(包括 YOLOv4、YOLOX、EfficientDet、RetinaNet)在 MSCOCO 上的表现。
  • 消融实验表明,DCFS 与 ADH 均对性能提升有显著贡献,其中 DCFS 在特征空间固化方面尤为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。