Skip to main content
QUICK REVIEW

[论文解读] Obj2Seq: Formatting Objects as Sequences with Class Prompt for Visual Tasks

Zhiyang Chen, Yousong Zhu|arXiv (Cornell University)|Sep 28, 2022
Advanced Neural Network Applications被引用 8
一句话总结

Obj2Seq 提出了一种统一的、以对象为中心的框架,将检测、分类和姿态估计等多样化视觉任务重新表述为基于类别提示的序列生成问题。通过将对象视为序列单元,并使用提示视觉指示器和通用序列预测器,该方法在 COCO 对象检测上达到 45.7% AP,在多标签分类上达到 89.0% AP,在人体姿态估计上达到 65.0% AP,展示了在极少任务特定适配下跨任务的强大泛化能力。

ABSTRACT

Visual tasks vary a lot in their output formats and concerned contents, therefore it is hard to process them with an identical structure. One main obstacle lies in the high-dimensional outputs in object-level visual tasks. In this paper, we propose an object-centric vision framework, Obj2Seq. Obj2Seq takes objects as basic units, and regards most object-level visual tasks as sequence generation problems of objects. Therefore, these visual tasks can be decoupled into two steps. First recognize objects of given categories, and then generate a sequence for each of these objects. The definition of the output sequences varies for different tasks, and the model is supervised by matching these sequences with ground-truth targets. Obj2Seq is able to flexibly determine input categories to satisfy customized requirements, and be easily extended to different visual tasks. When experimenting on MS COCO, Obj2Seq achieves 45.7% AP on object detection, 89.0% AP on multi-label classification and 65.0% AP on human pose estimation. These results demonstrate its potential to be generally applied to different visual tasks. Code has been made available at: https://github.com/CASIA-IVA-Lab/Obj2Seq.

研究动机与目标

  • 为解决多样化视觉任务中输出格式异构且输出维度高、面向对象的输出所带来的挑战。
  • 通过用户指定目标类别提示,实现灵活的、与任务无关的推理。
  • 设计一个统一框架,将对象识别与属性序列生成解耦,以适应多样化视觉任务。
  • 在无需任务特定头设计或微调的前提下,提升模型的可控性与跨任务泛化能力。
  • 探索将序列到序列范式从自然语言处理扩展至视觉领域,特别是面向对象级任务的可行性。

提出的方法

  • 该框架以图像和类别提示作为输入,利用提示视觉指示器检测指定类别的对象。
  • 提示视觉指示器采用可学习或基于 CLIP 初始化的类别提示向量,以引导对象检测和对象查询初始化。
  • 对象特征通过对象变换器解码器处理,为每个检测到的对象生成上下文感知的表示。
  • 通用序列预测器以统一的自回归方式,为每个对象生成与任务相关的属性序列(如边界框、关键点、标签)。
  • 模型通过序列匹配损失进行端到端训练,以对齐预测序列与各任务的真实目标。
  • 保留策略机制允许在推理过程中过滤无关类别,利用类别存在分数以在策略变化时稳定预测。

实验结果

研究问题

  • RQ1是否可以仅通过极少的架构修改,将基于对象的视觉任务统一在一个序列生成框架下?
  • RQ2使用类别提示在多大程度上提升了模型对用户定义目标类别的可控性与适应性?
  • RQ3单一模型在检测、分类和姿态估计等多样化视觉任务上,能否实现具有竞争力的性能?
  • RQ4该框架在推理时对象类别保留策略发生变化时,其鲁棒性如何?
  • RQ5视觉领域中的基于序列的建模是否能在无需任务特定头设计的前提下,实现与任务专用模型相当的性能?

主要发现

  • 当仅针对检测任务进行训练时,Obj2Seq 在 MS COCO 对象检测上达到 45.7% AP,展现出在标准基准上的强劲性能。
  • 该模型在多标签图像分类任务上达到 89.0% AP,表明其对多类别输出格式具有强大的泛化能力。
  • 在具有关键点标注的人体姿态估计任务上,该模型达到 65.0% AP,表明其对结构化属性序列建模的有效性。
  • 使用基于 CLIP 初始化的提示向量相比随机初始化可提升 0.3% 性能,但需微调以实现最优对齐。
  • 在推理阶段采用不同保留策略时,模型保持稳健,mAP 在不同 top-K 和基于阈值的过滤策略下波动不超过 0.2%。
  • 在物体存在分支中引入类别存在分数,可提升当训练与推理阶段保留策略不一致时的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。