Skip to main content
QUICK REVIEW

[论文解读] D^2ETR: Decoder-Only DETR with Computationally Efficient Cross-Scale Attention

Jun-Yu Lin, Xiaofeng Mao|arXiv (Cornell University)|Mar 2, 2022
Advanced Neural Network Applications被引用 15
一句话总结

D²ETR 提出了一种仅解码器的物体检测框架,用计算高效的跨尺度注意力机制(CECA)替代了传统的编码器-解码器 Transformer 架构,使解码器能够直接关注主干网络生成的多尺度、精细化融合特征。该方法在 COCO 上实现了 50.0 AP 的最先进精度,仅需 106 GFLOPs,优于可变形 DETR,同时降低了显存占用和推理延迟。

ABSTRACT

DETR is the first fully end-to-end detector that predicts a final set of predictions without post-processing. However, it suffers from problems such as low performance and slow convergence. A series of works aim to tackle these issues in different ways, but the computational cost is yet expensive due to the sophisticated encoder-decoder architecture. To alleviate this issue, we propose a decoder-only detector called D^2ETR. In the absence of encoder, the decoder directly attends to the fine-fused feature maps generated by the Transformer backbone with a novel computationally efficient cross-scale attention module. D^2ETR demonstrates low computational complexity and high detection accuracy in evaluations on the COCO benchmark, outperforming DETR and its variants.

研究动机与目标

  • 通过在 DETR 中移除编码器,简化端到端物体检测,降低架构复杂度和计算成本。
  • 解决现有基于 Transformer 的检测器中多尺度特征融合与跨注意力机制带来的高计算成本问题。
  • 在不增加模型参数量或推理延迟的前提下,提升检测精度,尤其是小物体的检测性能。
  • 探究仅解码器架构是否能在物体检测任务中达到甚至超越编码器-解码器架构的性能表现。
  • 开发一个即插即用的模块(CECA),实现在轻量化、端到端检测流程中的高效跨尺度特征交互。

提出的方法

  • 提出一种仅解码器的检测框架(D²ETR),移除编码器,直接关注来自 Transformer 主干网络的精细化多尺度特征。
  • 引入计算高效的跨尺度注意力(CECA),其中高层特征作为查询,低层特征作为键和值,实现稀疏且高效的跨尺度交互。
  • 在解码器中使用标准多头注意力或可变形注意力机制,用于对象查询的优化与预测。
  • 引入一种新型的标记标签损失,以增强特征表示,尤其在使用初始化查询的可变形变体中效果显著。
  • 应用一种位置感知损失,通过约束预测框坐标来提升边界框定位精度。
  • 将 CECA 作为即插即用模块,可替换任意基于 Transformer 的检测器中的编码器,支持与多种主干网络和解码器的灵活部署。

实验结果

研究问题

  • RQ1在端到端物体检测中,仅解码器的 Transformer 架构是否能在无编码器的情况下实现具有竞争力的检测性能?
  • RQ2如何在保持检测精度(尤其是小物体检测)的同时,使跨尺度特征交互实现计算高效?
  • RQ3与标准 DETR 及其变体相比,移除编码器对模型复杂度、推理速度和精度有何影响?
  • RQ4在仅解码器设置下,辅助损失(标记标签损失与位置感知损失)是否能进一步提升性能,特别是在对象查询由主干特征初始化的情况下?
  • RQ5所提出的 CECA 模块在效率与精度方面,与标准跨注意力和可变形注意力机制相比如何,尤其是在多尺度检测任务中?

主要发现

  • D²ETR 在 COCO 2017 上达到 50.0 AP,采用可变形 D²ETR-SwinT 主干网络,优于可变形 DETR(44.5 AP),且仅需 106 GFLOPs。
  • 可变形 D²ETR 将显存占用从 1109MB(可变形 DETR)降低至 776MB,并将吞吐量从 187 提升至 355 张图像/秒(在 16GB V100 GPU 上)。
  • 经 TensorRT FP16 优化后,推理时间降至 43ms,显著缩小了与基线模型的延迟差距,同时保持高精度。
  • 当结合标记标签损失时,CECA 模块使 AP 相较基线 D²ETR 提升 +8.3,相较可变形 DETR 提升 +5.5,展现出强大的泛化能力。
  • 消融实验表明,尽管在无辅助损失时精度略有下降,但移除编码器使 GFLOPs 降低 49%(从 197 降至 106 GFLOPs),并提升了吞吐量。
  • 位置感知损失与标记标签损失显著提升了定位精度与特征表示能力,尤其在可变形变体中,当查询由主干特征初始化时效果更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。