[论文解读] D^2ETR: Decoder-Only DETR with Computationally Efficient Cross-Scale Attention
D²ETR 提出了一种仅解码器的物体检测框架,用计算高效的跨尺度注意力机制(CECA)替代了传统的编码器-解码器 Transformer 架构,使解码器能够直接关注主干网络生成的多尺度、精细化融合特征。该方法在 COCO 上实现了 50.0 AP 的最先进精度,仅需 106 GFLOPs,优于可变形 DETR,同时降低了显存占用和推理延迟。
DETR is the first fully end-to-end detector that predicts a final set of predictions without post-processing. However, it suffers from problems such as low performance and slow convergence. A series of works aim to tackle these issues in different ways, but the computational cost is yet expensive due to the sophisticated encoder-decoder architecture. To alleviate this issue, we propose a decoder-only detector called D^2ETR. In the absence of encoder, the decoder directly attends to the fine-fused feature maps generated by the Transformer backbone with a novel computationally efficient cross-scale attention module. D^2ETR demonstrates low computational complexity and high detection accuracy in evaluations on the COCO benchmark, outperforming DETR and its variants.
研究动机与目标
- 通过在 DETR 中移除编码器,简化端到端物体检测,降低架构复杂度和计算成本。
- 解决现有基于 Transformer 的检测器中多尺度特征融合与跨注意力机制带来的高计算成本问题。
- 在不增加模型参数量或推理延迟的前提下,提升检测精度,尤其是小物体的检测性能。
- 探究仅解码器架构是否能在物体检测任务中达到甚至超越编码器-解码器架构的性能表现。
- 开发一个即插即用的模块(CECA),实现在轻量化、端到端检测流程中的高效跨尺度特征交互。
提出的方法
- 提出一种仅解码器的检测框架(D²ETR),移除编码器,直接关注来自 Transformer 主干网络的精细化多尺度特征。
- 引入计算高效的跨尺度注意力(CECA),其中高层特征作为查询,低层特征作为键和值,实现稀疏且高效的跨尺度交互。
- 在解码器中使用标准多头注意力或可变形注意力机制,用于对象查询的优化与预测。
- 引入一种新型的标记标签损失,以增强特征表示,尤其在使用初始化查询的可变形变体中效果显著。
- 应用一种位置感知损失,通过约束预测框坐标来提升边界框定位精度。
- 将 CECA 作为即插即用模块,可替换任意基于 Transformer 的检测器中的编码器,支持与多种主干网络和解码器的灵活部署。
实验结果
研究问题
- RQ1在端到端物体检测中,仅解码器的 Transformer 架构是否能在无编码器的情况下实现具有竞争力的检测性能?
- RQ2如何在保持检测精度(尤其是小物体检测)的同时,使跨尺度特征交互实现计算高效?
- RQ3与标准 DETR 及其变体相比,移除编码器对模型复杂度、推理速度和精度有何影响?
- RQ4在仅解码器设置下,辅助损失(标记标签损失与位置感知损失)是否能进一步提升性能,特别是在对象查询由主干特征初始化的情况下?
- RQ5所提出的 CECA 模块在效率与精度方面,与标准跨注意力和可变形注意力机制相比如何,尤其是在多尺度检测任务中?
主要发现
- D²ETR 在 COCO 2017 上达到 50.0 AP,采用可变形 D²ETR-SwinT 主干网络,优于可变形 DETR(44.5 AP),且仅需 106 GFLOPs。
- 可变形 D²ETR 将显存占用从 1109MB(可变形 DETR)降低至 776MB,并将吞吐量从 187 提升至 355 张图像/秒(在 16GB V100 GPU 上)。
- 经 TensorRT FP16 优化后,推理时间降至 43ms,显著缩小了与基线模型的延迟差距,同时保持高精度。
- 当结合标记标签损失时,CECA 模块使 AP 相较基线 D²ETR 提升 +8.3,相较可变形 DETR 提升 +5.5,展现出强大的泛化能力。
- 消融实验表明,尽管在无辅助损失时精度略有下降,但移除编码器使 GFLOPs 降低 49%(从 197 降至 106 GFLOPs),并提升了吞吐量。
- 位置感知损失与标记标签损失显著提升了定位精度与特征表示能力,尤其在可变形变体中,当查询由主干特征初始化时效果更明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。