[论文解读] EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model
EVF-SAM 提出了一种简单而有效的方法,通过在多模态编码器(如 BEIT-3)中早期融合视觉与语言特征,使 Segment Anything Model (SAM) 能够支持文本提示的指代表达分割。该方法在 RefCOCO/+/g 基准上实现了最先进性能,参数量比先前基于大语言模型(LLM)的方法减少了 82%,表明早期视觉-语言融合显著提升了分割精度,优于仅使用文本或后期融合的方法。
Segment Anything Model (SAM) has attracted widespread attention for its superior interactive segmentation capabilities with visual prompts while lacking further exploration of text prompts. In this paper, we empirically investigate what text prompt encoders (e.g., CLIP or LLM) are good for adapting SAM for referring expression segmentation and introduce the Early Vision-language Fusion-based SAM (EVF-SAM). EVF-SAM is a simple yet effective referring segmentation method which exploits multimodal prompts (i.e., image and text) and comprises a pre-trained vision-language model to generate referring prompts and a SAM model for segmentation. Surprisingly, we observe that: (1) multimodal prompts and (2) vision-language models with early fusion (e.g., BEIT-3) are beneficial for prompting SAM for accurate referring segmentation. Our experiments show that the proposed EVF-SAM based on BEIT-3 can obtain state-of-the-art performance on RefCOCO/+/g for referring expression segmentation and demonstrate the superiority of prompting SAM with early vision-language fusion. In addition, the proposed EVF-SAM with 1.32B parameters achieves remarkably higher performance while reducing nearly 82% of parameters compared to previous SAM methods based on large multimodal models.
研究动机与目标
- 为解决当前 Segment Anything Model (SAM) 仅支持点、框等视觉提示,缺乏有效文本提示分割能力的问题。
- 探究哪些文本提示编码器(如 CLIP 或大语言模型 LLM)在将 SAM 适配至指代表达分割(RES)任务时最为有效。
- 探索多模态提示(图像 + 文本)以及早期视觉-语言融合是否能提升 SAM 在 RES 任务中的性能。
- 开发一种轻量化、高效且端到端的框架,避免 LLM 微调带来的复杂指令模板和高计算成本。
- 证明在视觉-语言模型(如 BEIT-3)中采用早期融合,相比后期融合或独立文本编码器,在使用自然语言描述提示 SAM 时表现更优。
提出的方法
- EVF-SAM 集成一个预训练的多模态编码器(如 BEIT-3),实现早期视觉-语言融合,生成联合图像-文本嵌入作为 SAM 的提示。
- 该方法使用简单的投影头将多模态嵌入转换为与 SAM 的提示编码器兼容的提示嵌入。
- 模型在 RefCOCO、RefCOCO+ 和 RefCOCOg 等指代表达分割数据集上进行端到端训练,使用标准交叉熵损失。
- 框架利用现成的基础模型(SAM 和 BEIT-3),无需架构修改,从而实现可扩展性和参数效率。
- 通过利用早期融合编码器的丰富多模态表征,该方法支持短句和长句形式的指代表达,包括空间描述和语义描述。
- 轻量化变体 EVF-SAM with Efficient-SAM 在减少 600M 参数的同时保持了强劲性能。
实验结果
研究问题
- RQ1与仅使用文本提示相比,使用多模态提示(图像和文本)是否能提升 SAM 在指代表达分割任务中的性能?
- RQ2在提示编码器中采用早期视觉-语言融合,是否比后期融合或独立文本编码器更有效,用于使用自然语言提示 SAM?
- RQ3尽管参数量远少于 LLM,一个轻量级视觉-语言模型(如 BEIT-3)是否能在提示 SAM 进行指代分割时超越 LLM?
- RQ4多模态编码器的选择(如 CLIP、ViLT、BEIT-3)如何影响文本提示 SAM 的分割精度?
- RQ5EVF-SAM 在不同 SAM 变体(如 SAM-Huge 与 Efficient-SAM)和不同基准(RefCOCO/+/g)上的泛化能力如何?
主要发现
- 使用 BEIT-3-Large 的 EVF-SAM 在 RefCOCO/+/g 基准上达到最先进性能,平均 mIoU 达 78.0,超越先前基于 LLM 的方法。
- 与 LISA(先前最先进 LLM 方法)相比,该模型参数量减少 82%,仅需 1.32B 参数,却优于更大参数量的模型。
- BEIT-3-Base(较小编码器)导致性能显著下降(如 RefCOCOg 上平均 mIoU 为 71.6),证实多模态编码器的模型容量至关重要。
- EVF-SAM 在 RefCOCOg 上比基于 CLIP 的提示方法高出 12.7% 的平均 mIoU,证明其对长句和复杂指代表达的理解能力更优。
- 该方法在更少的训练数据下表现更优,且无需依赖手工设计的指令模板,与 LLM 方法形成对比。
- EVF-SAM 中的 Efficient-SAM-S 变体与 SAM-Huge 相比性能下降可忽略,证明该框架在不同 SAM 变体间具有良好的兼容性与效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。