[论文解读] Open Vocabulary Object Detection with Proposal Mining and Prediction Equalization
本文提出 MEDet,一种用于开放词汇目标检测的框架,通过在线提议挖掘(OPM)提升提议级别的视觉-语言对齐,并通过离线类别差异化调节(OCA)减少基础类别与新类别之间的预测偏差。MEDet 在 MS COCO 上将新类别 mAP 从 29.1% 提升至 32.6%,在 LVIS 上实现 22.4% 的掩码 AP,提升 1.4%,通过优化视觉-语言知识与平衡的置信度校准,展现出最先进性能。
Open-vocabulary object detection (OVD) aims to scale up vocabulary size to detect objects of novel categories beyond the training vocabulary. Recent work resorts to the rich knowledge in pre-trained vision-language models. However, existing methods are ineffective in proposal-level vision-language alignment. Meanwhile, the models usually suffer from confidence bias toward base categories and perform worse on novel ones. To overcome the challenges, we present MEDet, a novel and effective OVD framework with proposal mining and prediction equalization. First, we design an online proposal mining to refine the inherited vision-semantic knowledge from coarse to fine, allowing for proposal-level detection-oriented feature alignment. Second, based on causal inference theory, we introduce a class-wise backdoor adjustment to reinforce the predictions on novel categories to improve the overall OVD performance. Extensive experiments on COCO and LVIS benchmarks verify the superiority of MEDet over the competing approaches in detecting objects of novel categories, e.g., 32.6% AP50 on COCO and 22.4% mask mAP on LVIS.
研究动机与目标
- 解决开放词汇目标检测(OVD)中因粗粒度图像级描述注释而导致的提议级别视觉-语言对齐不准确问题。
- 克服 OVD 模型在微调过程中因类别不平衡与灾难性遗忘而对基础类别产生预测偏差的问题。
- 通过使用非结构化图像描述,在提议级别精炼视觉-语言知识,提升新类别检测性能。
- 通过可学习的离线校准机制,实现在基础类别与新类别之间更可靠且平衡的置信度预测。
- 通过集成端到端提议挖掘与置信度均衡化,实现在 COCO 与 LVIS 基准上的最先进性能。
提出的方法
- 提出在线提议挖掘(OPM),一种三阶段、由粗到精的端到端框架,通过利用图像描述文本提取细粒度提议概念,以优化视觉-语言对齐。
- 利用图像与文本嵌入之间的交叉注意力机制,增强文本嵌入的判别能力,生成更准确的提议-概念对。
- 应用相似性熵与 IoU 基于的过滤策略,去除噪声提议并合并碎片化提议,提升对齐质量。
- 引入离线类别差异化调节(OCA),一种后训练校准方法,通过学习类别特定的偏差向量来重新加权预测分数。
- 使用可微损失函数优化偏差向量 β,以最小化各类别预测与实际 AP/AR 性能之间的差异。
- 在不重新训练的情况下,将学习到的偏差向量 β 重用于不同 OVD 模型(如 OVR-CNN、Detic),实现可迁移性与可复现性。
实验结果
研究问题
- RQ1能否通过图像描述中的在线端到端提议挖掘,改善开放词汇目标检测中的提议级别视觉-语言对齐?
- RQ2在提议级别精炼视觉-语言知识是否能带来更好的检测性能,尤其是对新类别?
- RQ3一种简单且离线的类别差异化调节机制是否能有效减少 OVD 中基础类别与新类别之间的置信度偏差?
- RQ4所学习的置信度校准偏差在不同 OVD 模型之间(在相同描述数据集上训练)的可迁移性如何?
- RQ5所提出方法的性能对超参数(如 OPM 中的 IoU 阈值与 OCA 中的 γ)的敏感性如何?
主要发现
- MEDet 在 MS COCO 上将新类别 mAP 从 29.1% 提升至 32.6%,相比之前最先进方法实现 3.5% 的绝对提升。
- 在 LVIS 基准上,MEDet 实现 22.4% 的掩码 AP,较之前最先进方法提升 1.4%。
- OCA 组件在多个 OVD 模型中均提升了新类别与基础类别的性能,平均 mAP 提升超过 1%。
- OCA 偏差向量 β 具备可迁移性:应用于 OVR-CNN 与 Detic 时,mAP 分别提升 3.0 和 1.1 个百分点,无需重新训练。
- 超参数消融实验表明,OCA 对 γ 的敏感性较低,在较宽范围内取值时均能保持最优性能。
- OPM 的消融研究证实,三个组件——概念增强、噪声去除与碎片合并——均对性能有贡献,完整 OPM 在 COCO 上实现 47.5% 的 mAP。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。