Skip to main content
QUICK REVIEW

[论文解读] DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection

Hao Zhang, Feng Li|arXiv (Cornell University)|Mar 7, 2022
Advanced Neural Network Applications被引用 747
一句话总结

DINO 通过对比去噪训练、混合查询初始化和向前看两步机制提升 DETR,在更小的模型和数据 footprint 下实现了 COCO 端到端对象检测的最先进水平。它在不同骨干网络和预训练方案上展示出强大的可扩展性。

ABSTRACT

We present DINO ( extbf{D}ETR with extbf{I}mproved de extbf{N}oising anch extbf{O}r boxes), a state-of-the-art end-to-end object detector. % in this paper. DINO improves over previous DETR-like models in performance and efficiency by using a contrastive way for denoising training, a mixed query selection method for anchor initialization, and a look forward twice scheme for box prediction. DINO achieves $49.4$AP in $12$ epochs and $51.3$AP in $24$ epochs on COCO with a ResNet-50 backbone and multi-scale features, yielding a significant improvement of $ extbf{+6.0}$ extbf{AP} and $ extbf{+2.7}$ extbf{AP}, respectively, compared to DN-DETR, the previous best DETR-like model. DINO scales well in both model size and data size. Without bells and whistles, after pre-training on the Objects365 dataset with a SwinL backbone, DINO obtains the best results on both COCO exttt{val2017} ($ extbf{63.2}$ extbf{AP}) and exttt{test-dev} ( extbf{$ extbf{63.3}$AP}). Compared to other models on the leaderboard, DINO significantly reduces its model size and pre-training data size while achieving better results. Our code will be available at \url{https://github.com/IDEACVR/DINO}.

研究动机与目标

  • 推动端到端对象检测,不依赖手工构建的组件如 NMS 或锚框。
  • 通过新颖的训练与查询策略提高 DETR‑类模型的训练效率与准确性。
  • 在降低数据/参数需求的同时,展示跨骨干网络和大规模预训练的可扩展性。

提出的方法

  • 在 Transformer 框架内将检测器查询形式化为动态的四维锚框,并使用可变形注意力。
  • 引入对比去噪训练以创建正负样本,从而实现鲁棒的一对一匹配。
  • 提出混合查询初始化,从编码器特征中初始化位置查询,同时使内容查询可学习。
  • 实现 Look Forward Twice,使后层的梯度能够反向 refined 信息,帮助前层参数更好地进行框预测。

实验结果

研究问题

  • RQ1对比去噪是否能够改善对 DETR‑类模型的一对一匹配并减少重复项?
  • RQ2混合查询初始化是否在不影响内容查询学习的情况下增强空间先验?
  • RQ3Look-Forward-Twice 是否通过利用后层细化信息来改善早期层的框预测?
  • RQ4与早期 DETR‑类模型相比,DINO 在较小骨干和大规模预训练下的表现如何?
  • RQ5在不同数据量和模型规模下,端到端 Transformer 检测是否具备与经典检测器竞争甚至优越性?

主要发现

  • DINO 在 COCO val2017 上使用 ResNet-50,12 轮时获得 49.0 AP(4-scale)和 49.4 AP(5-scale),并在 24 轮达到 51.3 AP,超越了以往的 DETR‑类模型。
  • 在 Object s365 上预训练的 SwinL 骨干下,DINO 在 COCO val2017 上达到 63.2 AP,在 test-dev 上达到 63.3 AP,创下端到端 DETR‑类的新 SOTA。
  • DINO-5scale 在 val2017 的 AP 比 DINO-4scale 高出 +0.4,并在 test-dev 达到更高的 AP,尽管使用了更多尺度;两者均显示出强大的可扩展性。
  • 消融研究表明 CDN(对比去噪)和 look-forward-twice 相比优化的 DN-DETR 与纯查询选择有收益,完整的 DINO 配置获得最佳结果。
  • DINO 将模型规模降至 SwinV2-G 的 1/15,预训练数据需求降低(骨干 1/60,检测数据 1/5),同时取得更优的 COCO 分数。
  • 在小目标方面,DINO 显示出显著提升(12 轮情况下 +7.5 AP),相较基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。