Skip to main content
QUICK REVIEW

[论文解读] LLaFS: When Large Language Models Meet Few-Shot Segmentation

Lanyun Zhu, Tianrun Chen|arXiv (Cornell University)|Nov 28, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

LLaFS 是首个通过使用特定任务指令和区域-属性表格,利用大语言模型(LLMs)实现端到端少样本图像分割的框架,通过基于伪样本的课程预训练策略实现最先进性能,在多个基准测试中显著优于先前方法。

ABSTRACT

This paper proposes LLaFS, the first attempt to leverage large language models (LLMs) in few-shot segmentation. In contrast to the conventional few-shot segmentation methods that only rely on the limited and biased information from the annotated support images, LLaFS leverages the vast prior knowledge gained by LLM as an effective supplement and directly uses the LLM to segment images in a few-shot manner. To enable the text-based LLM to handle image-related tasks, we carefully design an input instruction that allows the LLM to produce segmentation results represented as polygons, and propose a region-attribute table to simulate the human visual mechanism and provide multi-modal guidance. We also synthesize pseudo samples and use curriculum learning for pretraining to augment data and achieve better optimization. LLaFS achieves state-of-the-art results on multiple datasets, showing the potential of using LLMs for few-shot computer vision tasks.

研究动机与目标

  • 解决传统少样本分割方法仅依赖有限且有偏见的支持图像所带来的局限性。
  • 探索大语言模型(LLMs)作为丰富且可泛化的先验知识来源,以提升分割性能的潜力。
  • 使基于文本的 LLM 能够在少样本设置下直接生成分割掩码,突破其作为辅助角色的限制。
  • 设计一种多模态指令机制,有效整合视觉与文本信息,以实现更优的引导效果。
  • 通过合成伪样本生成与课程学习策略,缓解少样本学习中的数据稀缺问题。

提出的方法

  • 设计特定任务的指令提示,明确向 LLM 定义少样本分割任务,使其能够以多边形形式生成分割输出。
  • 引入区域-属性对应表,通过将物体区域与描述性属性关联,模拟人类视觉认知,提供细粒度的多模态引导。
  • 采用伪样本合成方法,生成合成的支持-查询图像对,以扩充预训练数据分布。
  • 在预训练过程中应用课程学习策略,逐步增加合成样本的复杂度,以提升模型收敛性与优化效果。
  • 利用合成数据和基于指令的监督,对 LLM 进行端到端微调,直接生成分割掩码。
  • 在预测后应用优化步骤,以提升边缘定位精度,尤其在复杂或含多物体的场景中表现更优。

实验结果

研究问题

  • RQ1大语言模型能否在不依赖仅支持图像特征的前提下,有效用于少样本图像分割?
  • RQ2如何使基于文本的 LLM 适应理解并生成如多边形掩码等视觉分割输出?
  • RQ3结合视觉区域与文本属性的多模态上下文指令,在提升分割精度方面发挥何种作用?
  • RQ4合成伪样本与课程学习在缓解少样本视觉任务中的数据稀缺问题方面,其作用程度如何?
  • RQ5端到端基于 LLM 的分割是否优于传统基于特征引导的少样本分割方法?

主要发现

  • LLaFS 在多个少样本分割基准测试中达到最先进性能,报告的 mIoU 达到 74.2。
  • 若移除基于伪样本的课程预训练机制,mIoU 下降 10.7%,证明其在性能中起关键作用。
  • 消融实验表明,细粒度的上下文指令(包括属性-区域表和迭代优化)可带来最高达 4.5% 的 mIoU 提升。
  • 当多边形顶点数(M)超过 16 时,性能略有下降,表明 M=16 是在精度与模型复杂度之间达到最佳平衡的最优选择。
  • 损失曲线显示,课程预训练在预训练和微调阶段均实现了更快且更稳定的收敛。
  • 可视化结果证实,LLaFS 即使在多物体图像中也能生成准确的分割掩码,且经过优化后边缘定位进一步改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。