Skip to main content
QUICK REVIEW

[论文解读] Learning to Prompt Segment Anything Models

Jiaxing Huang, Kai Jiang|arXiv (Cornell University)|Jan 9, 2024
Advanced Neural Network Applications被引用 4
一句话总结

本文提出空间-语义提示学习(SSPrompt),一种通过在高维嵌入空间中优化并选择性地利用预训练提示编码器来学习最优空间与语义提示的方法。SSPrompt在多个少样本分割基准上实现最先进性能,在16-shot设置下于ADE20K数据集上相比基线模型最高提升16.0 mIoU。

ABSTRACT

Segment Anything Models (SAMs) like SEEM and SAM have demonstrated great potential in learning to segment anything. The core design of SAMs lies with Promptable Segmentation, which takes a handcrafted prompt as input and returns the expected segmentation mask. SAMs work with two types of prompts including spatial prompts (e.g., points) and semantic prompts (e.g., texts), which work together to prompt SAMs to segment anything on downstream datasets. Despite the important role of prompts, how to acquire suitable prompts for SAMs is largely under-explored. In this work, we examine the architecture of SAMs and identify two challenges for learning effective prompts for SAMs. To this end, we propose spatial-semantic prompt learning (SSPrompt) that learns effective semantic and spatial prompts for better SAMs. Specifically, SSPrompt introduces spatial prompt learning and semantic prompt learning, which optimize spatial prompts and semantic prompts directly over the embedding space and selectively leverage the knowledge encoded in pre-trained prompt encoders. Extensive experiments show that SSPrompt achieves superior image segmentation performance consistently across multiple widely adopted datasets.

研究动机与目标

  • 通过从2D坐标转移到高维嵌入空间,解决空间提示优化中搜索空间受限的问题。
  • 缓解预训练文本提示编码器因偏向前景对象描述而带来的副作用。
  • 构建统一框架,同时学习空间与语义提示以提升分割性能。
  • 通过选择性地利用预训练提示编码器中的知识,实现在少样本设置下的有效提示学习。
  • 通过避免对大型提示编码器进行全量微调,提升训练效率,同时保持高性能。

提出的方法

  • 提出SpaPrompt:可学习权重将来自固定空间提示编码器的默认空间提示嵌入(512维)与可学习空间提示嵌入融合。
  • 提出SemPrompt:可学习权重将来自固定文本提示编码器的默认语义提示嵌入与可学习语义提示嵌入结合,形成优化后的语义提示。
  • 在嵌入空间中联合优化空间与语义提示,实现比2D坐标优化更大的搜索空间。
  • 通过可学习权重实现选择性融合,利用提示编码器中已学习良好的前景知识,同时最小化对学习较差的背景知识的影响。
  • 通过避免对大型预训练提示编码器进行微调,仅更新小型可学习提示嵌入,保持推理效率。
  • 使用每类仅少数标注样本进行训练,实现在多样化数据集上的少样本适应。

实验结果

研究问题

  • RQ1与2D坐标优化相比,在高维嵌入空间中优化空间提示如何提升分割性能?
  • RQ2预训练文本提示编码器因以前景为中心的预训练数据,会引入多大程度的偏差?如何缓解这一问题?
  • RQ3联合学习空间与语义提示是否能带来分割准确率的互补性提升?
  • RQ4在低数据场景下,特别是少样本设置下,该方法表现如何?
  • RQ5在选择性提示学习与全量微调之间,性能提升与训练效率的权衡如何?

主要发现

  • 在16-shot设置下,SSPrompt在ADE20K上达到55.2 mIoU,相比基线SEEM-T提升16.0 mIoU。
  • 在Cityscapes上,SSPrompt将mIoU从SEEM-T的39.2提升至55.2(16-shot),表明在不同数据集上均具有一致性增益。
  • 即使仅使用4-shot数据,该方法仍保持优异性能,显示出在低数据场景下的强大泛化能力。
  • 相比SEEM-T,训练时间减少36.0%,显存使用降低53.5%,归因于避免了对完整编码器的微调。
  • 可视化注意力权重显示,前景类别值更高,背景类别值更低,证实了对已学习良好知识的选择性利用。
  • 消融实验表明,SemPrompt与SpaPrompt中的可学习权重对性能至关重要,因其支持选择性知识利用,并避免了学习较差的背景知识带来的负面影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。