[论文解读] CoDet: Co-Occurrence Guided Region-Word Alignment for Open-Vocabulary Object Detection
CoDet 提出了一种新颖的开放词汇目标检测框架,通过将区域-词汇对齐建模为跨共享同一概念的图像组之间的视觉相似性上的共现物体发现,从而绕过了对预对齐视觉-语言模型的依赖。通过在概念组内采用文本引导的、基于原型的区域匹配方法,CoDet 实现了最先进性能,在 OV-LVIS 上达到 37.0 APₘⁿᵒᵛ 和 44.7 APₘᵃˡˡ,分别超越之前最先进方法 4.2 和 9.8 个百分点。
Deriving reliable region-word alignment from image-text pairs is critical to learn object-level vision-language representations for open-vocabulary object detection. Existing methods typically rely on pre-trained or self-trained vision-language models for alignment, which are prone to limitations in localization accuracy or generalization capabilities. In this paper, we propose CoDet, a novel approach that overcomes the reliance on pre-aligned vision-language space by reformulating region-word alignment as a co-occurring object discovery problem. Intuitively, by grouping images that mention a shared concept in their captions, objects corresponding to the shared concept shall exhibit high co-occurrence among the group. CoDet then leverages visual similarities to discover the co-occurring objects and align them with the shared concept. Extensive experiments demonstrate that CoDet has superior performances and compelling scalability in open-vocabulary detection, e.g., by scaling up the visual backbone, CoDet achieves 37.0 $ ext{AP}^m_{novel}$ and 44.7 $ ext{AP}^m_{all}$ on OV-LVIS, surpassing the previous SoTA by 4.2 $ ext{AP}^m_{novel}$ and 9.8 $ ext{AP}^m_{all}$. Code is available at https://github.com/CVMI-Lab/CoDet.
研究动机与目标
- 为解决现有开放词汇目标检测器依赖预训练视觉-语言模型导致定位与泛化能力差的局限性。
- 消除开放词汇检测中区域-词汇对齐对预对齐视觉-语言空间的依赖。
- 利用图像中共享同一概念的共现视觉模式,发现可靠的区域-词汇对应关系。
- 通过引入文本引导的相似性估计与基于原型的区域聚合,提升对齐准确率与可扩展性。
- 在无需人工标注区域-文本配对的情况下,实现在开放词汇检测基准上的最先进性能。
提出的方法
- CoDet 通过采样其标题中包含共享概念的图像来构建语义组,为共现发现提供基础。
- 通过计算组内跨图像区域相似度,识别共现物体,重点关注与共享概念一致出现的区域。
- 利用软加权方法从组内区域提议中构建原型,以增强对噪声相似度估计的鲁棒性。
- 将文本引导整合到区域相似度计算中,使其具备概念感知能力,从而更有效地区分无关或外观相似的物体。
- 由此产生的原型-概念对作为弱监督信号,用于训练开放词汇目标检测器,从而避免对预对齐 VLM 的依赖。
- 该方法在多种主干网络(包括 ResNet50、Swin-B 和 EVA02-L)上均表现出良好的可扩展性与有效性。
实验结果
研究问题
- RQ1能否利用图像组之间的物体共现来发现可靠的区域-词汇对齐,而无需依赖预训练视觉-语言模型?
- RQ2如何联合使用视觉相似性与文本引导来提升开放词汇检测中的对齐准确率?
- RQ3在噪声相似度估计下,基于原型的区域聚合是否优于启发式选择策略?
- RQ4组大小如何影响共现概念发现,特别是在人工标注标题数据与网络爬取数据中?
- RQ5所提方法能否在 OV-LVIS 和 COCO 等开放词汇检测基准上实现最先进性能?
主要发现
- CoDet 在 OV-LVIS 基准上达到 37.0 APₘⁿᵒᵛ 和 44.7 APₘᵃˡˡ,分别超越之前最先进方法 4.2 和 9.8 个百分点。
- 采用 EVA02-L 主干网络时,CoDet 在 OV-LVIS 上实现 37.0 APₘⁿᵒᵛ,表明其在更大视觉主干网络上具有强大可扩展性。
- 基于原型的策略相比启发式基线,将新类别 AP 提升 3.7 个百分点,展现出对噪声相似度的鲁棒性及处理多实例的能力。
- 文本引导使新类别 AP₅₀ 从 26.6 提升至 30.6,显著减少了如椅子腿等干扰概念的影响。
- 在 OV-COCO 上,组大小从 2 增加到 8 时性能略有下降,表明人工标注标题可能存在偏差,损害共现发现效果。
- CoDet 在跨数据集检测中于 COCO 和 Objects365 上均保持强劲性能,证实其具备良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。