[论文解读] DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection
DINO 通过对比去噪训练、混合查询初始化和向前看两步机制提升 DETR,在更小的模型和数据 footprint 下实现了 COCO 端到端对象检测的最先进水平。它在不同骨干网络和预训练方案上展示出强大的可扩展性。
We present DINO ( extbf{D}ETR with extbf{I}mproved de extbf{N}oising anch extbf{O}r boxes), a state-of-the-art end-to-end object detector. % in this paper. DINO improves over previous DETR-like models in performance and efficiency by using a contrastive way for denoising training, a mixed query selection method for anchor initialization, and a look forward twice scheme for box prediction. DINO achieves $49.4$AP in $12$ epochs and $51.3$AP in $24$ epochs on COCO with a ResNet-50 backbone and multi-scale features, yielding a significant improvement of $ extbf{+6.0}$ extbf{AP} and $ extbf{+2.7}$ extbf{AP}, respectively, compared to DN-DETR, the previous best DETR-like model. DINO scales well in both model size and data size. Without bells and whistles, after pre-training on the Objects365 dataset with a SwinL backbone, DINO obtains the best results on both COCO exttt{val2017} ($ extbf{63.2}$ extbf{AP}) and exttt{test-dev} ( extbf{$ extbf{63.3}$AP}). Compared to other models on the leaderboard, DINO significantly reduces its model size and pre-training data size while achieving better results. Our code will be available at \url{https://github.com/IDEACVR/DINO}.
研究动机与目标
- 推动端到端对象检测,不依赖手工构建的组件如 NMS 或锚框。
- 通过新颖的训练与查询策略提高 DETR‑类模型的训练效率与准确性。
- 在降低数据/参数需求的同时,展示跨骨干网络和大规模预训练的可扩展性。
提出的方法
- 在 Transformer 框架内将检测器查询形式化为动态的四维锚框,并使用可变形注意力。
- 引入对比去噪训练以创建正负样本,从而实现鲁棒的一对一匹配。
- 提出混合查询初始化,从编码器特征中初始化位置查询,同时使内容查询可学习。
- 实现 Look Forward Twice,使后层的梯度能够反向 refined 信息,帮助前层参数更好地进行框预测。
实验结果
研究问题
- RQ1对比去噪是否能够改善对 DETR‑类模型的一对一匹配并减少重复项?
- RQ2混合查询初始化是否在不影响内容查询学习的情况下增强空间先验?
- RQ3Look-Forward-Twice 是否通过利用后层细化信息来改善早期层的框预测?
- RQ4与早期 DETR‑类模型相比,DINO 在较小骨干和大规模预训练下的表现如何?
- RQ5在不同数据量和模型规模下,端到端 Transformer 检测是否具备与经典检测器竞争甚至优越性?
主要发现
- DINO 在 COCO val2017 上使用 ResNet-50,12 轮时获得 49.0 AP(4-scale)和 49.4 AP(5-scale),并在 24 轮达到 51.3 AP,超越了以往的 DETR‑类模型。
- 在 Object s365 上预训练的 SwinL 骨干下,DINO 在 COCO val2017 上达到 63.2 AP,在 test-dev 上达到 63.3 AP,创下端到端 DETR‑类的新 SOTA。
- DINO-5scale 在 val2017 的 AP 比 DINO-4scale 高出 +0.4,并在 test-dev 达到更高的 AP,尽管使用了更多尺度;两者均显示出强大的可扩展性。
- 消融研究表明 CDN(对比去噪)和 look-forward-twice 相比优化的 DN-DETR 与纯查询选择有收益,完整的 DINO 配置获得最佳结果。
- DINO 将模型规模降至 SwinV2-G 的 1/15,预训练数据需求降低(骨干 1/60,检测数据 1/5),同时取得更优的 COCO 分数。
- 在小目标方面,DINO 显示出显著提升(12 轮情况下 +7.5 AP),相较基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。