[论文解读] Fast Convergence of DETR with Spatially Modulated Co-Attention
本文提出空间调制协同注意力(SMCA),一种即插即用模块,通过引入类似高斯的权重图作为位置感知的空间先验,引导解码器中的协同注意力机制,从而加速DETR的收敛。SMCA在108个周期内达到45.6 mAP,超越DETR在500个周期时的43.3 mAP,同时通过极少的架构改动显著缩短了训练时间。
The recently proposed Detection Transformer (DETR) model successfully applies Transformer to objects detection and achieves comparable performance with two-stage object detection frameworks, such as Faster-RCNN. However, DETR suffers from its slow convergence. Training DETR from scratch needs 500 epochs to achieve a high accuracy. To accelerate its convergence, we propose a simple yet effective scheme for improving the DETR framework, namely Spatially Modulated Co-Attention (SMCA) mechanism. The core idea of SMCA is to conduct location-aware co-attention in DETR by constraining co-attention responses to be high near initially estimated bounding box locations. Our proposed SMCA increases DETR's convergence speed by replacing the original co-attention mechanism in the decoder while keeping other operations in DETR unchanged. Furthermore, by integrating multi-head and scale-selection attention designs into SMCA, our fully-fledged SMCA can achieve better performance compared to DETR with a dilated convolution-based backbone (45.6 mAP at 108 epochs vs. 43.3 mAP at 500 epochs). We perform extensive ablation studies on COCO dataset to validate SMCA. Code is released at https://github.com/gaopengcuhk/SMCA-DETR .
研究动机与目标
- 为解决DETR收敛缓慢的问题,其需要500个周期才能收敛。
- 在不修改DETR核心架构(除解码器外)的前提下,提升训练效率。
- 通过引入引导注意力聚焦于可能物体位置的空间先验,提升检测性能。
- 探索全局自注意力与多尺度特征融合在加速端到端目标检测方面的有效性。
提出的方法
- SMCA用一种基于动态预测的物体中心与尺度生成的二维高斯类似空间权重图的空间调制协同注意力机制,替代DETR解码器中的原始协同注意力机制。
- 这些空间权重图与协同注意力特征图逐元素相乘,将注意力限制在预测物体位置附近的区域,从而提高特征聚合效率。
- 该方法在解码器中集成多头注意力机制,每个头学习独立的空间先验,实现多样化的感受野,以提升特征选择能力。
- 混合编码器架构结合了尺度内与多尺度自注意力机制,高效地在不同尺度间传播信息,同时最小化FLOPs。
- 多尺度自注意力使所有空间位置和尺度的特征能够相互交互,增强特征的判别能力。
- 解码器中的尺度选择注意力使每个头能够自适应选择相关特征尺度,提升检测鲁棒性。
实验结果
研究问题
- RQ1通过可学习的高斯类似注意力图引入空间先验,是否能显著加速DETR的收敛?
- RQ2与标准DETR相比,协同注意力的空间调制如何影响检测精度与训练效率?
- RQ3多尺度自注意力与多头空间调制是否能进一步提升基本SMCA模块的性能?
- RQ4SMCA与Deformable DETR和TSP-RCNN等快速收敛检测器相比,在mAP和不同物体尺寸上的泛化能力如何?
- RQ5全局自注意力与多尺度特征的融合是否相比局部注意力机制能更好地实现大物体的定位?
主要发现
- 基础SMCA模块在50个周期时达到41.0 mAP,在108个周期时达到42.7 mAP,显著优于DETR在500个周期时的43.3 mAP。
- 完整SMCA模型在108个周期时达到45.6 mAP,超越DETR-DC5在500个周期时的43.3 mAP,训练时间减少45%。
- SMCA在大物体上的表现优于Deformable DETR(60.4 mAP vs. 59.0 mAP),证明了全局注意力相比局部采样的优势。
- SMCA在109个周期时达到45.6 mAP,优于Faster R-CNN-FPN-R50在相同周期下的42.0 mAP,尽管其使用更少的主干特征和更简单的注意力机制。
- 采用2-intra-inter-2-intra自注意力设计的混合编码器在参数量更少、FLOPs更低的情况下,达到43.7 mAP,优于纯多尺度或尺度内编码器。
- SMCA在50个周期时与TSP-RCNN的mAP相当(43.7 vs. 43.8),但在更长训练周期下表现更优(96和108个周期时分别为45.6 vs. 45.0),显示出更优的长期收敛性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。