Skip to main content
QUICK REVIEW

[论文解读] OV-PARTS: Towards Open-Vocabulary Part Segmentation

Meng Wei, Xiaoyu Yue|arXiv (Cornell University)|Oct 8, 2023
Multimodal Machine Learning Applications被引用 5
一句话总结

该论文提出了OV-PARTS,一个用于开放词汇部件分割的基准,解决了部件级分割中的挑战,包括复杂边界、标注有限以及开放粒度。该研究提出了三项新任务——广义零样本分割、跨数据集分割和少样本分割,并通过基于CLIP的提示工程与微调,改进了两阶段和单阶段基线模型,在清理后的Pascal-Part-116和ADE20K-Part-234数据集上实现了最先进的性能,展现出强大的零样本和少样本泛化能力。

ABSTRACT

Segmenting and recognizing diverse object parts is a crucial ability in applications spanning various computer vision and robotic tasks. While significant progress has been made in object-level Open-Vocabulary Semantic Segmentation (OVSS), i.e., segmenting objects with arbitrary text, the corresponding part-level research poses additional challenges. Firstly, part segmentation inherently involves intricate boundaries, while limited annotated data compounds the challenge. Secondly, part segmentation introduces an open granularity challenge due to the diverse and often ambiguous definitions of parts in the open world. Furthermore, the large-scale vision and language models, which play a key role in the open vocabulary setting, struggle to recognize parts as effectively as objects. To comprehensively investigate and tackle these challenges, we propose an Open-Vocabulary Part Segmentation (OV-PARTS) benchmark. OV-PARTS includes refined versions of two publicly available datasets: Pascal-Part-116 and ADE20K-Part-234. And it covers three specific tasks: Generalized Zero-Shot Part Segmentation, Cross-Dataset Part Segmentation, and Few-Shot Part Segmentation, providing insights into analogical reasoning, open granularity and few-shot adapting abilities of models. Moreover, we analyze and adapt two prevailing paradigms of existing object-level OVSS methods for OV-PARTS. Extensive experimental analysis is conducted to inspire future research in leveraging foundational models for OV-PARTS. The code and dataset are available at https://github.com/OpenRobotLab/OV_PARTS.

研究动机与目标

  • 为解决开放词汇部件分割缺乏标准化基准的问题,该问题面临复杂边界、标注有限以及开放粒度等挑战。
  • 探究视觉-语言模型在部件级分割中进行类比推理、开放粒度理解以及少样本适应的能力。
  • 提升基础模型(如CLIP)在部件级识别中的可迁移性,该能力因模型以物体为中心的预训练方式而受到限制。
  • 提供一个统一的基准,包含经过优化的数据集(Pascal-Part-116 和 ADE20K-Part-234),以标准化评估并激发未来研究。

提出的方法

  • 提出一个新的基准OV-PARTS,基于清理并重新组织的Pascal-Part和ADE20K-Part版本,分别包含116个和234个部件类别。
  • 引入三项评估任务:广义零样本部件分割、跨数据集部件分割和少样本部件分割,以评估模型的泛化能力。
  • 从物体级开放词汇分割(OVSS)中借鉴两阶段和单阶段范式:两阶段方法采用类别无关的掩码提议,随后通过基于CLIP的分类,结合物体感知提示和组合提示。
  • 提出物体掩码提示(Object Mask Prompting),用于在提议阶段注入物体上下文信息;并提出组合提示微调(Compositional Prompt Tuning),以引导CLIP的注意力从物体转移到部件。
  • 采用视觉适配器(VA)、语言适配器(L)和FiLM(F)进行提示微调,并对CLIPSeg不同组件(如VA+L+F+D)的微调进行消融实验。
  • 以可见类与不可见类mIoU的调和平均值作为主要指标,并通过Oracle-Obj和Pred-Obj设置评估对物体-部件混淆的鲁棒性。

实验结果

研究问题

  • RQ1在零样本设置下,模型能否通过类比推理,将已见物体类别的部件分割能力泛化到未见物体类别?
  • RQ2当在部件词汇和粒度水平不同的数据集之间迁移时,模型的部件分割知识表现如何?
  • RQ3基础模型在仅使用少量标注样本的情况下,能在多大程度上被适配用于部件分割?哪些微调策略最为有效?
  • RQ4不同的提示微调策略(如物体感知、组合提示)在多大程度上提升了CLIP识别部件而非物体的能力?
  • RQ5在开放词汇部件分割中,微调CLIPSeg不同组件时,性能权衡与失败模式是什么?

主要发现

  • 在少样本设置下,经过VA+L+F+D微调的CLIPSeg模型在Pascal-Part-116上达到35.04%的调和mIoU,在ADE20K-Part-234上达到33.13%,优于其他消融实验配置。
  • 视觉适配器微调(VA+F)在Pascal-Part-116上提升性能,但在ADE20K-Part-234上表现较差,表明存在数据集特定的可迁移性差距。
  • 对解码器(D)进行微调在ADE20K-Part-234上导致性能下降,表明在低数据环境下存在过拟合风险。
  • 在ADE20K-Part-234上,VA+L+F+D配置在Oracle-Obj下提升0.69%,但在Pred-Obj下下降1.2%,表明模型对部件的偏见增强。
  • 在Pred-Obj设置下,CATSeg在跨数据集分割中优于CLIPSeg,表明其具有更好的泛化能力与更低的过拟合风险,尽管参数量更大。
  • 定性结果表明,基于CLIP的模型在复杂部件描述中存在边界划分与语言理解方面的困难,尤其在跨数据集设置下更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。