Skip to main content
QUICK REVIEW

[论文解读] OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network

Tiancheng Zhao, Peng Liu|arXiv (Cornell University)|Sep 10, 2022
Multimodal Machine Learning Applications参考文献 57被引用 8
一句话总结

OmDet 提出了一种语言感知的目标检测框架,通过持续的、多数据集的视觉-语言预训练,实现了最先进的零样本/少样本泛化性能。通过使用多模态检测网络与语言条件特征融合,并结合一种新颖的训练策略,OmDet 克服了不同数据集间类别体系冲突与前景/背景不一致的问题,在 ODinW 的 35 项下游任务中实现了最先进性能,学习了超过 400 万个独特的视觉概念,数据源自 2000 万张图像。

ABSTRACT

The advancement of object detection (OD) in open-vocabulary and open-world scenarios is a critical challenge in computer vision. This work introduces OmDet, a novel language-aware object detection architecture, and an innovative training mechanism that harnesses continual learning and multi-dataset vision-language pre-training. Leveraging natural language as a universal knowledge representation, OmDet accumulates a "visual vocabulary" from diverse datasets, unifying the task as a language-conditioned detection framework. Our multimodal detection network (MDN) overcomes the challenges of multi-dataset joint training and generalizes to numerous training datasets without manual label taxonomy merging. We demonstrate superior performance of OmDet over strong baselines in object detection in the wild, open-vocabulary detection, and phrase grounding, achieving state-of-the-art results. Ablation studies reveal the impact of scaling the pre-training visual vocabulary, indicating a promising direction for further expansion to larger datasets. The effectiveness of our deep fusion approach is underscored by its ability to learn jointly from multiple datasets, enhancing performance through knowledge sharing.

研究动机与目标

  • 为解决开放词汇和少样本目标检测的挑战,通过从多个视觉-语言数据集持续学习来实现。
  • 解决在标签集合不同的数据集间联合训练时存在的类别体系冲突和前景/背景不一致问题。
  • 开发一种可扩展的语言条件检测框架,能够动态适应任意用户定义的对象类别。
  • 证明通过多数据集预训练扩大视觉词汇量可提升零样本/少样本以及参数高效微调的性能。
  • 在涵盖 35 项下游检测任务的多样化、真实世界基准 ODinW 上实现最先进结果。

提出的方法

  • 提出 OmDet,一种语言感知的目标检测架构,将检测任务建模为基于任务条件的自由形式自然语言输入问题。
  • 引入多模态检测网络(MDN),在多个阶段融合视觉与文本特征,以实现基于输入任务描述的动态定位与分类。
  • 设计一种新颖的多数据集训练算法,无需合并标签体系即可统一不同数据集,实现具有不同标签集合的数据集之间的联合学习。
  • 采用大规模预训练方案,使用超过 2000 万张图像和 400 万个唯一对象标签,涵盖人工标注与伪标签数据。
  • 利用提示调优(prompt tuning)和仅头部微调,实现对下游任务的参数高效适应,尤其适用于领域内数据有限的场景。
  • 在 MDN 模块中应用自顶向下的迭代优化机制,使候选框从整张图像区域逐步演化为聚焦于特定对象区域,经过多个阶段完成。

实验结果

研究问题

  • RQ1检测器能否在无需人工标签体系对齐的情况下,从多样化目标检测数据集的持续流中有效学习?
  • RQ2联合多数据集预训练在目标检测的零样本和少样本泛化性能方面有何影响?
  • RQ3通过多数据集学习扩大视觉概念词汇量,能在多大程度上提升参数高效微调(如提示调优)的性能?
  • RQ4所提出的语言感知检测框架是否在开放词汇检测基准上优于现有视觉-语言预训练方法?
  • RQ5该模型的动态、任务条件行为在视觉注意力与边界框优化中如何体现?

主要发现

  • OmDet 在 ODinW 基准上实现了最先进性能,尽管其预训练语料规模小于 GLIP,但在零样本评估中平均精度高出 1.1 个百分点。
  • 在少样本检测任务(≤200 张训练图像)中,OmDet 相较于其基础模型 OmDet-C,平均精度提升了 6.41 个百分点,展现出强大的少样本泛化能力。
  • 当预训练包含 GCC 数据集时,模型的零样本性能从 9.8 提升至 16.0 AP,表明多样化、大规模的图文数据对性能至关重要。
  • 与 OmDet-C 相比,使用 OmDet 预训练进行参数高效微调(如提示调优)的性能下降显著减少(从 65.9% 降至 45.5% 的相对下降),证明其在低资源适应场景下的有效性。
  • 可视化结果证实,OmDet 以自顶向下的、任务感知的方式动态优化对象提议,在 2–3 个阶段内将关注焦点从整张图像区域逐步缩小至特定目标。
  • AP 曲线显示,随着预训练词汇量的增加(对数尺度),性能呈持续上升趋势,表明更大的视觉概念覆盖范围可带来更强的泛化能力和特征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。