Skip to main content
QUICK REVIEW

[论文解读] DQ-DETR: DETR with Dynamic Query for Tiny Object Detection

Yi-Xin Huang, Hou-I Liu|arXiv (Cornell University)|Apr 4, 2024
Advanced Image and Video Retrieval Techniques被引用 4
一句话总结

DQ-DETR 提出了一种动态查询机制,用于改进 DETR 在航空图像中对微小目标的检测性能,通过分类计数模块和密度感知特征增强,自适应地调整对象查询的数量和位置编码。该方法在 AI-TOD-V2 数据集上实现了 30.2% 的最先进 mAP,显著优于先前方法。

ABSTRACT

Despite previous DETR-like methods having performed successfully in generic object detection, tiny object detection is still a challenging task for them since the positional information of object queries is not customized for detecting tiny objects, whose scale is extraordinarily smaller than general objects. Also, DETR-like methods using a fixed number of queries make them unsuitable for aerial datasets, which only contain tiny objects, and the numbers of instances are imbalanced between different images. Thus, we present a simple yet effective model, named DQ-DETR, which consists of three different components: categorical counting module, counting-guided feature enhancement, and dynamic query selection to solve the above-mentioned problems. DQ-DETR uses the prediction and density maps from the categorical counting module to dynamically adjust the number of object queries and improve the positional information of queries. Our model DQ-DETR outperforms previous CNN-based and DETR-like methods, achieving state-of-the-art mAP 30.2% on the AI-TOD-V2 dataset, which mostly consists of tiny objects. Our code will be available at https://github.com/hoiliu-0801/DQ-DETR.

研究动机与目标

  • 为解决固定查询 DETR 类模型在极端实例不平衡的航空图像中检测微小目标的局限性。
  • 通过动态调整对象查询数量,提升稀疏和密集场景下的检测召回率。
  • 通过融合密度图与视觉特征,增强查询对微小目标的位置感知能力。
  • 通过查询数量和位置的自适应调整,减少稀疏图像中的误报和密集图像中的漏检。
  • 设计一种与数据集无关的分类计数模块,根据图像中实例密度自适应调整查询数量。

提出的方法

  • 引入一种分类计数模块,基于数据集统计将每张图像中的实例数量划分为四类:N ≤ 10,10 < N ≤ 100,100 < N ≤ 500,以及 N > 500。
  • 利用预测的计数类别动态设置 Transformer 解码器中的对象查询数量,避免固定-K 的限制。
  • 从计数模块生成密度图,并将其与编码器特征融合,以增强微小目标的前景表征。
  • 将增强的特征图用于优化对象查询的位置嵌入,提升定位精度。
  • 采用可学习的查询选择机制,根据预测实例的空间分布动态调整查询位置。
  • 使用伪代码流程,通过计算每张图像实例数量的均值和方差,自动定义计数类别,无需人工设定阈值。

实验结果

研究问题

  • RQ1动态查询机制是否能提升在实例数量高度不平衡的航空图像中对微小目标的检测性能?
  • RQ2动态调整查询数量在稀疏和密集场景下对召回率和精确率有何影响?
  • RQ3将密度图与视觉特征融合在多大程度上能提升微小目标的定位能力?
  • RQ4在不进行人工阈值调优的情况下,基于数据集统计训练的分类计数模块是否能在不同航空数据集中实现良好泛化?
  • RQ5与固定查询和密集查询的 DETR 变体相比,所提方法在 mAP 和小目标 AP 上表现如何?

主要发现

  • DQ-DETR 在 AI-TOD-V2 数据集上实现了 30.2% 的最先进 mAP,较先前 SOTA 方法在 AP 上提升 16.6%,在 APvt 上提升 20.5%。
  • 四分类的分类计数模块整体分类准确率达 94.6%,对实例数 ≤10 的图像准确率达 97.7%。
  • 使用五类而非四类分类导致 mAP 下降 1.4 分,主要因在罕见的高密度情况(N > 500)下性能下降,证实了类别不平衡处理的重要性。
  • 消融实验表明,计数引导的查询调整与密度增强特征的结合,使 AP 相较基线 DINO-DETR 提升 4.3 分。
  • 可视化结果表明,与 Deformable-DETR 相比,DQ-DETR 生成的特征图更具信息量,且误报和漏检更少。
  • 该方法通过根据实例密度自适应调整查询数量和位置,有效减少了密集图像中的漏检和稀疏图像中的误报。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。