[论文解读] Universal Instance Perception as Object Discovery and Retrieval
本文提出 UNINEXT,一种统一的实例感知模型,将多种任务(如目标检测、实例分割、指代表达理解及视频跟踪)统一为单一的提示引导型对象发现与检索框架。通过利用早期特征融合与灵活的基于 Transformer 的解码器,UNINEXT 在 20 个基准测试中实现了最先进性能,且仅使用单一、参数高效的模型。
All instance perception tasks aim at finding certain objects specified by some queries such as category names, language expressions, and target annotations, but this complete field has been split into multiple independent subtasks. In this work, we present a universal instance perception model of the next generation, termed UNINEXT. UNINEXT reformulates diverse instance perception tasks into a unified object discovery and retrieval paradigm and can flexibly perceive different types of objects by simply changing the input prompts. This unified formulation brings the following benefits: (1) enormous data from different tasks and label vocabularies can be exploited for jointly training general instance-level representations, which is especially beneficial for tasks lacking in training data. (2) the unified model is parameter-efficient and can save redundant computation when handling multiple tasks simultaneously. UNINEXT shows superior performance on 20 challenging benchmarks from 10 instance-level tasks including classical image-level tasks (object detection and instance segmentation), vision-and-language tasks (referring expression comprehension and segmentation), and six video-level object tracking tasks. Code is available at https://github.com/MasterBin-IIAU/UNINEXT.
研究动机与目标
- 将从图像级检测到视频跟踪等碎片化的实例感知任务统一为单一、连贯的框架。
- 克服特定任务模型的局限性,包括参数冗余、知识迁移不足以及在不同标签词汇表之间联合训练困难。
- 通过类别名称、语言表达或引用标注实现灵活的提示驱动对象感知,且无需架构更改。
- 通过联合训练大规模多任务数据,提升低资源任务的性能。
- 通过统一架构共享模型参数,实现参数效率与计算节省。
提出的方法
- 将 10 项实例感知任务重新构型为统一的提示引导型对象发现与检索范式,其中提示引导发现 N 个对象候选,随后通过实例-提示匹配得分进行检索。
- 引入提示生成模块,包含参考文本编码器与视觉编码器,将多样化提示类型(文本或视觉引用)嵌入共享表示空间。
- 采用早期融合模块,在实例解码器之前将视觉特征与提示嵌入进行拼接或注意力交互,以实现深层跨模态交互。
- 使用基于 Transformer 的目标检测器作为实例解码器,生成 N 个对象候选,并根据与提示的匹配得分检索最相关实例。
- 采用基于提示嵌入的动态查询学习,以更好地捕捉检测实例之间的关系,尤其在跟踪与分割任务中受益显著。
- 通过单一模型架构与共享参数,实现跨不同标签空间与数据分布的任务联合训练,避免固定大小分类器的限制。
实验结果
研究问题
- RQ1单一统一模型能否通过通用框架有效解决多样化的实例感知任务(包括检测、分割、跟踪与指代表达理解)?
- RQ2视觉与提示嵌入的早期融合对不同提示模态的性能影响如何,特别是在罕见或复杂指代任务中?
- RQ3在多任务实例感知背景下,动态查询初始化与静态查询初始化相比有何相对优势?
- RQ4在多个实例感知任务上进行联合训练在多大程度上提升了泛化能力与性能,尤其是在低资源基准上?
- RQ5统一模型能否在性能更优的同时,相比特定任务模型实现更高的参数效率?
主要发现
- UNINEXT 在 20 个具有挑战性的基准测试中,涵盖 10 项实例级任务,均达到最先进性能,包括目标检测(COCO 上 AP 66.2)、指代表达分割(RefCOCO 上 P@0.5 71.1)以及视频实例分割(YouTube-VIS 2019 上 AP 76.8,使用 ViT-H 主干)。
- 消融实验表明,若移除早期特征融合,VOS 上的掩码质量(J&F)下降 21.4 分,凸显跨模态交互在提示引导任务中的关键作用。
- 动态查询生成在多数任务上略优于静态查询,但静态查询在 VIS 上高出 2.8 AP,表明其在长序列中对实例间关系建模更优。
- 与特定任务模型相比,统一模型在目标检测上提升 +0.5 AP,指代表达理解(REC)上提升 +2.1 P@0.5,VOS 上提升 +2.8 J&F,RVOS 上提升 +4.0 J&F,VIS 上提升 +2.9 AP,证明联合学习的优势。
- UNINEXT 实现显著的参数效率,通过单一模型共享所有任务,避免了特定任务模型所需的独立训练与推理流程,从而节省计算冗余。
- 该模型在不同领域与任务间泛化能力出色,表明在多样化数据上进行联合预训练可提升零样本与少样本性能,尤其对 R-VOS 与 MOTS 等低资源任务有益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。