Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Panoptic Segmentation With Foundation Models

Markus Käppeler, Kürsat Petek|arXiv (Cornell University)|Sep 19, 2023
Advanced Neural Network ApplicationsComputer Science被引用 3
一句话总结

该论文提出SPINO,一种少样本全景分割方法,利用冻结的DINOv2主干网络,仅通过10张标注图像生成高质量伪标签。通过在这些少量标注数据上训练轻量级语义分割和边界估计分支,SPINO生成的伪标签性能可与全监督方法相媲美,在仅使用0.29%训练标签的情况下,Cityscapes数据集上达到35.9的PQ分数。

ABSTRACT

Current state-of-the-art methods for panoptic segmentation require an immense amount of annotated training data that is both arduous and expensive to obtain posing a significant challenge for their widespread adoption. Concurrently, recent breakthroughs in visual representation learning have sparked a paradigm shift leading to the advent of large foundation models that can be trained with completely unlabeled images. In this work, we propose to leverage such task-agnostic image features to enable few-shot panoptic segmentation by presenting Segmenting Panoptic Information with Nearly 0 labels (SPINO). In detail, our method combines a DINOv2 backbone with lightweight network heads for semantic segmentation and boundary estimation. We show that our approach, albeit being trained with only ten annotated images, predicts high-quality pseudo-labels that can be used with any existing panoptic segmentation method. Notably, we demonstrate that SPINO achieves competitive results compared to fully supervised baselines while using less than 0.3% of the ground truth labels, paving the way for learning complex visual recognition tasks leveraging foundation models. To illustrate its general applicability, we further deploy SPINO on real-world robotic vision systems for both outdoor and indoor environments. To foster future research, we make the code and trained models publicly available at http://spino.cs.uni-freiburg.de.

研究动机与目标

  • 通过减少对大规模人工标注数据集的依赖,降低全景分割的标注成本。
  • 探索通用基础模型是否可在全景分割中实现少样本学习。
  • 开发一种从极小监督中生成高质量伪标签的方法,用于后续全景分割任务。
  • 实现在机器人领域中全景分割的现实世界部署,同时将标注工作量降至最低。
  • 为未来少样本视觉识别研究提供公开可用的框架。

提出的方法

  • 利用冻结的DINOv2主干网络,从无标注图像中提取自监督、任务无关的视觉特征。
  • 仅使用10张标注图像,训练两个轻量级、分支专用的网络:一个用于语义分割,一个用于边界估计。
  • 在更大规模的原始无标注图像上,通过训练好的分支以离线方式生成全景伪标签。
  • 应用数据增强(随机裁剪、颜色抖动)和测试时增强(多尺度集成)以提升伪标签质量。
  • 采用多头架构结合MLP进行特征精炼,其在伪标签生成中表现优于k-NN、线性层和CNN,表现最佳。
  • 使用1个的批量大小以获得最优伪标签质量,并按比例调整学习率。

实验结果

研究问题

  • RQ1像DINOv2这样的基础模型是否能仅用极少人工标注数据实现少样本全景分割?
  • RQ2仅用10张标注图像生成的伪标签质量与全监督基线相比如何?
  • RQ3在低样本设置下,哪些架构选择和训练策略能最大化伪标签质量?
  • RQ4生成的伪标签是否能有效用于训练任何现有的全景分割模型?
  • RQ5该方法在不同真实世界环境和数据集上的泛化能力如何?

主要发现

  • SPINO仅使用10张标注图像,在Cityscapes数据集上实现35.9的全景质量(PQ)分数,相当于全训练集的0.29%。
  • 当使用100张标注图像时,SPINO的PQ达到42.9,接近全监督ResNet-50基线模型的性能(PQ 43.5)。
  • 与标准推理相比,测试时多尺度集成推理使PQ提升10.6分,证明了集成预测的有效性。
  • 在伪标签生成方面,该方法优于k-NN、线性层和4层CNN,其中MLP表现最强。
  • SPINO生成的伪标签在公开数据集(Cityscapes、KITTI-360)以及内部真实世界机器人数据集(包括室内外环境)上均取得具有竞争力的结果。
  • 消融实验表明,当标注图像数量从1张增加到100张时,mIoU、PQ和RQ持续提升,但超过100张后收益递减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。