[论文解读] Multi-modal Queried Object Detection in the Wild
MQ-Det 提出了一种即插即用、高效的多模态查询目标检测框架,通过门控类别可扩展的感知器模块,将视觉范例与文本查询融合,从而增强语言查询检测器。通过引入视觉条件化的掩码语言预测,该方法在不进行微调的情况下,仅使用 GLIP 预训练时间的 3%,在 LVIS 上实现了 +7.8% AP,在 13 项少样本任务上实现了 +6.3% 的平均 AP。
We introduce MQ-Det, an efficient architecture and pre-training strategy design to utilize both textual description with open-set generalization and visual exemplars with rich description granularity as category queries, namely, Multi-modal Queried object Detection, for real-world detection with both open-vocabulary categories and various granularity. MQ-Det incorporates vision queries into existing well-established language-queried-only detectors. A plug-and-play gated class-scalable perceiver module upon the frozen detector is proposed to augment category text with class-wise visual information. To address the learning inertia problem brought by the frozen detector, a vision conditioned masked language prediction strategy is proposed. MQ-Det's simple yet effective architecture and training strategy design is compatible with most language-queried object detectors, thus yielding versatile applications. Experimental results demonstrate that multi-modal queries largely boost open-world detection. For instance, MQ-Det significantly improves the state-of-the-art open-set detector GLIP by +7.8% AP on the LVIS benchmark via multi-modal queries without any downstream finetuning, and averagely +6.3% AP on 13 few-shot downstream tasks, with merely additional 3% modulating time required by GLIP. Code is available at https://github.com/YifanXu74/MQ-Det.
研究动机与目标
- 解决开放词汇目标检测中纯文本查询描述粒度有限的问题。
- 在不造成灾难性遗忘或大量重训练的前提下,实现基于视觉范例的细粒度识别。
- 开发一种即插即用、高效的调制策略,以保持冻结的基础检测器的泛化能力。
- 通过联合使用文本和图像查询,实现强大的少样本与零样本检测性能。
- 通过引入视觉条件化的掩码语言预测,克服调制过程中学习惯性的问题。
提出的方法
- 提出一种门控类别可扩展感知器(GCP)模块,在文本编码器的每个高层阶段,通过类别特定的交叉注意力机制,将视觉线索注入文本嵌入。
- 采用条件门控机制,根据视觉查询质量调制融合过程,实现视觉细节的自适应整合。
- 应用类似残差连接的结构,以在允许文本嵌入空间扰动的同时保留初始泛化能力。
- 在调制过程中采用视觉条件化的掩码语言预测策略:随机掩码文本标记,并强制视觉查询独立预测物体类别。
- 冻结原始检测主干网络,仅微调 GCP 模块,从而确保计算成本最低并避免灾难性遗忘。
- 在 Objects365 上进行训练,每类使用 5 个视觉范例及其对应的文本描述,实现强大的零样本泛化能力。
实验结果
研究问题
- RQ1多模态查询(文本 + 视觉范例)是否能显著提升开放词汇目标检测性能,超越纯文本查询?
- RQ2如何在不造成灾难性遗忘或大量重训练的前提下,有效融合视觉范例与文本查询?
- RQ3何种训练策略可克服使用视觉查询调制冻结基础检测器时的学习惯性?
- RQ4即插即用模块是否能以极低计算开销增强多种语言查询检测器?
- RQ5联合使用文本与图像查询在少样本和开放集基准上的性能提升程度如何?
主要发现
- MQ-Det 在不进行下游微调的情况下,仅使用 GLIP 预训练时间的 3%,在 LVIS 基准上将最先进检测器 GLIP 的性能提升了 +7.8% AP。
- 在 13 项少样本检测任务中,MQ-Det 相较于 GLIP 实现了 +6.3% 的平均 AP 提升,展现出强大的少样本泛化能力。
- 视觉条件化的掩码语言预测策略有效打破了学习惯性,实现了调制过程中更深层次的视觉知识整合。
- GCP 模块不引入任何类别特定参数,且可兼容任意语言查询检测器,具备广泛适用性。
- 即使每类仅使用 5 个视觉范例,该方法仍保持强大泛化能力,展现出极高的数据效率。
- 当检测器在未冻结的情况下进行微调时,LVIS 上的性能下降了 -6.0% AP,凸显了冻结训练策略的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。