Skip to main content
QUICK REVIEW

[论文解读] OpenVIS: Open-vocabulary Video Instance Segmentation

Pinxue Guo, Tony Jun Huang|arXiv (Cornell University)|May 26, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出了 OpenVIS,一种新型的开放词汇视频实例分割任务,支持通过文本提示实现零样本检测、分割与跟踪,无论训练类别是否覆盖该对象。该方法提出一种两阶段框架,采用二元交叉熵损失训练的掩码提议网络,结合 SquareCrop 后处理策略,以增强与 CLIP 等预训练视觉-语言模型的兼容性,在 BURST 数据集上相比全监督基线模型实现 148% 的性能提升。

ABSTRACT

Open-vocabulary Video Instance Segmentation (OpenVIS) can simultaneously detect, segment, and track arbitrary object categories in a video, without being constrained to categories seen during training. In this work, we propose InstFormer, a carefully designed framework for the OpenVIS task that achieves powerful open-vocabulary capabilities through lightweight fine-tuning with limited-category data. InstFormer begins with the open-world mask proposal network, encouraged to propose all potential instance class-agnostic masks by the contrastive instance margin loss. Next, we introduce InstCLIP, adapted from pre-trained CLIP with Instance Guidance Attention, which encodes open-vocabulary instance tokens efficiently. These instance tokens not only enable open-vocabulary classification but also offer strong universal tracking capabilities. Furthermore, to prevent the tracking module from being constrained by the training data with limited categories, we propose the universal rollout association, which transforms the tracking problem into predicting the next frame's instance tracking token. The experimental results demonstrate the proposed InstFormer achieve state-of-the-art capabilities on a comprehensive OpenVIS evaluation benchmark, while also achieves competitive performance in fully supervised VIS task.

研究动机与目标

  • 解决现有视频实例分割模型仅能识别其训练数据中固定封闭类别集内对象的局限性。
  • 实现在训练过程中未见类别的情况下,仅通过文本提示对任意对象实现零样本分割。
  • 构建一个稳健的评估基准,利用现有数据集对开放词汇视频实例分割进行评估,以衡量零样本泛化能力。
  • 提升掩码提议与预训练视觉-语言模型(如 CLIP)之间的兼容性,后者对输入失真和宽高比敏感。
  • 探索不同主干网络架构与训练数据设置在最大化开放词汇性能方面的有效性。

提出的方法

  • 将基于查询的掩码提议网络中的分类头替换为使用二元交叉熵损失训练的实例头,以鼓励生成所有潜在对象的提议,而不论其类别。
  • 应用一种新颖的 SquareCrop 后处理策略,将掩码提议裁剪为正方形宽高比,同时保留对象内容并最小化失真,从而提升与 CLIP 的兼容性。
  • 使用预训练视觉-语言模型(CLIP)计算每个提议与一组候选文本描述之间的视觉-文本相似度,并分配最相似的类别。
  • 在 COCO 和 YouTube-VIS 数据集的组合数据集(C+Y’)上训练掩码提议网络,该数据集包含掩码标注但无类别标签,以实现对未见类别的泛化能力。
  • 通过对比学习目标在掩码提议上微调 CLIP 视觉编码器,进一步对齐视觉表征与下游分割任务。
  • 利用仅包含掩码标注的 UVO 数据集(C+U’)进行额外预训练,以提升在罕见和未见类别上的掩码提议质量。

实验结果

研究问题

  • RQ1能否仅通过文本提示,在训练过程中无需类别标注的情况下,有效扩展视频实例分割模型以实现零样本开放词汇识别?
  • RQ2如何优化掩码提议网络,以生成高质量、与类别无关的掩码,涵盖视频中所有潜在对象,包括训练类别集外的对象?
  • RQ3在使用 CLIP 等预训练视觉-语言模型时,何种掩码提议后处理策略能最大化零样本分类准确率?
  • RQ4主干网络架构与训练数据(尤其是仅含掩码标注的数据)的选择如何影响开放词汇视频实例分割的性能?
  • RQ5所提框架在 COCO 数据集中未包含的罕见和未见类别上,其泛化能力达到何种程度?

主要发现

  • 所提出的 OpenVIS 框架在 BURST 数据集上相比全监督基线模型实现了 148% 的平均精度(AP)提升,证明了其强大的零样本泛化能力。
  • 与直接输入掩码相比,SquareCrop 后处理策略在 BURST 验证集上使基于 CLIP 的分类准确率提升 21%(绝对值);与缩放后的边界框裁剪相比,提升 23%。
  • 采用 Swin-L 主干网络与 ViT-B CLIP 编码器,并在 UVO 数据集(C+U’)上进行训练,可在 BURST 上达到 4.97 的 AP,表明该方法在更大模型与更多数据下具有良好的可扩展性。
  • 在 COCO 之外的 404 种不常见类别上,该方法使用 Swin-L 主干网络时达到 4.15 的 AP,表明其在罕见与未见类别上表现优异。
  • 当使用 ViT-B 作为 CLIP 视觉编码器时,模型达到 3.48 的 AP;使用 ResNet-50 时达到 2.56,表明在不同主干配置下均实现一致性能提升。
  • 消融实验确认,掩码提议网络中的二元损失显著提升了掩码覆盖度,并增强了对潜在实例(尤其是罕见类别)的检测能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。