[论文解读] Class-agnostic Object Detection with Multi-modal Transformer
本文提出一种基于多模态视觉变换器(MViTs)的无类别物体检测方法,该方法在图像-文本对上进行预训练,利用自然语言查询在不同领域中生成高质量的物体候选区域。主要贡献在于证明了MViTs在无需类别特定监督的情况下,仍能实现最先进的通用物体定位性能,这主要归因于训练过程中语言的结构语义,即使在移除图像字幕后依然有效,凸显了语言结构而非词汇内容在模型泛化中的重要性。
What constitutes an object? This has been a long-standing question in computer vision. Towards this goal, numerous learning-free and learning-based approaches have been developed to score objectness. However, they generally do not scale well across new domains and novel objects. In this paper, we advocate that existing methods lack a top-down supervision signal governed by human-understandable semantics. For the first time in literature, we demonstrate that Multi-modal Vision Transformers (MViT) trained with aligned image-text pairs can effectively bridge this gap. Our extensive experiments across various domains and novel objects show the state-of-the-art performance of MViTs to localize generic objects in images. Based on the observation that existing MViTs do not include multi-scale feature processing and usually require longer training schedules, we develop an efficient MViT architecture using multi-scale deformable attention and late vision-language fusion. We show the significance of MViT proposals in a diverse range of applications including open-world object detection, salient and camouflage object detection, supervised and self-supervised detection tasks. Further, MViTs can adaptively generate proposals given a specific language query and thus offer enhanced interactability. Code: \url{https://git.io/J1HPY}.
研究动机与目标
- 为解决无类别物体检测的挑战,该挑战在不同领域和新类别物体上缺乏可扩展且通用的解决方案。
- 探究在图像-文本对上预训练的多模态视觉变换器(MViTs)是否可作为无需类别特定监督的有效、通用的物体候选区域生成器。
- 探索语言结构与词汇内容在使视觉模型泛化至通用物体概念中的相对贡献。
- 开发一种高效、灵活的MViT架构(MAVL),结合多尺度可变形注意力与晚期特征融合,以提升物体定位性能。
- 展示基于MViT的候选区域在下游任务(如开放世界检测、显著物体检测和自监督学习)中的实用性。
提出的方法
- 该方法采用在大规模图像-文本数据集上预训练的多模态视觉变换器(MViT)架构,其数据包含对齐的图像-字幕对。
- 提出一种新型架构——多尺度注意力ViT与晚期融合(MAVL),通过可变形注意力实现多尺度特征提取,并在后期阶段融合视觉与语言表征,以提升定位精度。
- 通过自然语言查询(如“所有物体”或特定领域术语)提示MViT生成物体候选区域,实现交互式与自适应的候选区域生成。
- 模型通过对比学习目标进行端到端训练,即使在训练过程中移除字幕,也能将视觉区域与对应文本描述对齐。
- 通过在保持数据加载器结构的同时移除文本输入,开展消融研究,以隔离语言结构对泛化性能的贡献。
- 在自然图像、卫星图像、素描和绘画等多种领域上,使用标准检测基准对框架进行评估。
实验结果
研究问题
- RQ1预训练的多模态视觉变换器(MViTs)是否能在无需任何类别特定监督的情况下,实现无类别物体检测的最先进性能?
- RQ2在实现对通用物体概念的泛化方面,语言语义与语言结构(如序列和重复模式)的相对贡献是什么?
- RQ3所提出的MAVL架构(结合多尺度可变形注意力与晚期融合)相较于标准MViTs,在物体定位方面有何改进?
- RQ4MViT生成的候选区域在多大程度上能提升下游任务(如开放世界检测、显著物体检测和自监督学习)的性能?
- RQ5当使用简单的自然语言查询提示时,MViTs是否能泛化至域外和新类别物体?
主要发现
- MAVL在无类别物体检测中达到最先进性能,在自然图像、卫星图像、素描和绘画等多种领域中,优于自底向上候选区域方法和标准MViTs。
- 即使在训练过程中完全移除文本字幕,模型仍保持强大的泛化能力,表明语言结构(如对同一图像进行多次不同上下文的访问)比词汇内容更为关键。
- 消融研究显示,保留语言结构(如每张图像有多个上下文不同的字幕)可使Pascal-VOC上的AP50提升25.5个百分点(从16.2提升至61.6 AP50),而完全移除结构则导致性能下降。
- 仅使用MViT生成的前30个候选区域替代DETReg预训练中的Selective Search,即可显著提升无监督物体定位性能,证明了MViT候选区域的高质量。
- 在显著物体与伪装物体检测任务中,通过任务特定的文本查询,模型在无需任何任务特定微调的情况下,实现了与全监督模型相当的性能。
- 由于在预训练阶段通过图像-字幕对编码了语义与空间上下文,该模型能有效泛化至新类别与新领域(包括素描和绘画)。”
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。