[论文解读] Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
Grounding DINO 在 DINO 的基础上加入了具备落地预训练的能力,通过在多个管线阶段将语言与视觉紧密融合,使得开放集合目标检测与指认表达理解成为可能。
In this paper, we present an open-set object detector, called Grounding DINO, by marrying Transformer-based detector DINO with grounded pre-training, which can detect arbitrary objects with human inputs such as category names or referring expressions. The key solution of open-set object detection is introducing language to a closed-set detector for open-set concept generalization. To effectively fuse language and vision modalities, we conceptually divide a closed-set detector into three phases and propose a tight fusion solution, which includes a feature enhancer, a language-guided query selection, and a cross-modality decoder for cross-modality fusion. While previous works mainly evaluate open-set object detection on novel categories, we propose to also perform evaluations on referring expression comprehension for objects specified with attributes. Grounding DINO performs remarkably well on all three settings, including benchmarks on COCO, LVIS, ODinW, and RefCOCO/+/g. Grounding DINO achieves a $52.5$ AP on the COCO detection zero-shot transfer benchmark, i.e., without any training data from COCO. It sets a new record on the ODinW zero-shot benchmark with a mean $26.1$ AP. Code will be available at \url{https://github.com/IDEA-Research/GroundingDINO}.
研究动机与目标
- 通过使能对用语言输入描述的任意对象进行检测来激发开放集合对象检测。
- 用语言扩展闭集检测器,以推广到新概念。
- 提出一种多阶段融合方法,在 Transformer 检测器中将视觉与语言紧密整合。
提出的方法
- 引入一个特征增强器,在颈部堆叠自注意力和图像-文本跨模态注意力,用于跨模态融合。
- 实现一个语言引导的查询选择模块,从图像和文本特征初始化解码器查询。
- 添加具有图像和文本跨注意力层的跨模态解码器,用于对查询进行联合细化的跨模态解码器。
- 在子句级别表示文本提示,以避免类别名称之间的无关交互。
- 在预测对象与语言标记之间使用对比损失进行分类。
- 在双编码器-单解码器架构中进行训练,利用 Swin Transformer 图像骨干和 BERT 文本骨干。
实验结果
研究问题
- RQ1如何将语言信息整合到闭集检测器中,以实现开放集合对象检测?
- RQ2相比于部分融合方法,颈部、查询和解码器之间的紧密融合是否能提高开放集合和指认表达理解(REC)的性能?
- RQ3Grounding DINO 是否能够实现强零-shot 和 ODinW 结果,并扩展到指认表达理解数据集?
- RQ4子句级文本表示对多类别对齐表现有何影响?
主要发现
- Grounding DINO 在没有 COCO 训练数据的情况下实现 COCO 零-shot 转移的 52.5 AP,经过 COCO 微调后为 63.0 AP。
- Grounding DINO 在 ODinW 零-shot 基准测试上创造了新的最佳性能,平均 AP 为 26.1。
- Grounding DINO 在可比设置下优于 LVIS 和 ODinW 的 GLIP,并在更多数据下显示出更强的可扩展性。
- 该模型将开放集合评估扩展到 RefCOCO/+/g 数据集,展示了 REC 能力。
- 一个从 DINO 迁移的消融实验表明,当用预训练 DINO 权重初始化 Grounding DINO 时性能相当或有所提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。