Skip to main content
QUICK REVIEW

[论文解读] Ref-Diff: Zero-shot Referring Image Segmentation with Generative Models

Minheng Ni, Yabo Zhang|arXiv (Cornell University)|Aug 31, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用 3
一句话总结

Ref-Diff 提出了一种零样本指代图像分割方法,利用像 Stable Diffusion 这类生成模型隐式学习细粒度的视觉-语言关系,而无需训练数据或外部提议生成器。该方法仅使用生成模型即可达到与当前最先进弱监督模型相当的性能,并且在与判别模型(如 CLIP)结合时显著超越它们,证明了生成模型在此任务中具有有效性且能与判别模型互补。

ABSTRACT

Zero-shot referring image segmentation is a challenging task because it aims to find an instance segmentation mask based on the given referring descriptions, without training on this type of paired data. Current zero-shot methods mainly focus on using pre-trained discriminative models (e.g., CLIP). However, we have observed that generative models (e.g., Stable Diffusion) have potentially understood the relationships between various visual elements and text descriptions, which are rarely investigated in this task. In this work, we introduce a novel Referring Diffusional segmentor (Ref-Diff) for this task, which leverages the fine-grained multi-modal information from generative models. We demonstrate that without a proposal generator, a generative model alone can achieve comparable performance to existing SOTA weakly-supervised models. When we combine both generative and discriminative models, our Ref-Diff outperforms these competing methods by a significant margin. This indicates that generative models are also beneficial for this task and can complement discriminative models for better referring segmentation. Our code is publicly available at https://github.com/kodenii/Ref-Diff.

研究动机与目标

  • 通过利用生成模型的隐式视觉-语言理解能力,解决零样本指代图像分割的挑战,即在无配对训练数据的情况下进行分割。
  • 探究生成模型是否可作为内在实例提议生成器,从而消除对外部提议网络的需求。
  • 探索将生成模型与判别模型结合所带来的互补优势,以提升零样本设置下的分割精度。
  • 证明生成模型所具备的细粒度多模态理解能力,可实现无需训练的精确实例定位与分割。

提出的方法

  • 该方法使用预训练的文本到图像扩散模型(如 Stable Diffusion)基于指代表达生成注意力图,用于预测分割掩码。
  • 它利用生成模型的注意力机制,聚焦于指代文本中特定标记(尤其是主语标记)对应的视觉区域。
  • 该方法无需外部提议生成器,因为生成模型通过其注意力分布天然地生成实例级别的提议。
  • 最终分割通过聚合生成模型的注意力图获得,可通过与判别模型(如 CLIP)集成实现进一步优化。
  • 一种混合的 Ref-Diff 框架结合了生成模型的定位能力与判别模型的鲁棒分类能力,以提升性能。
  • 该方法端到端可微且仅支持推理,可在无需任何微调的情况下实现零样本部署。

实验结果

研究问题

  • RQ1像 Stable Diffusion 这类生成模型是否能隐式学习足够细粒度的视觉-语言关系,以实现零样本指代图像分割?
  • RQ2生成模型本身是否可作为有效的实例提议生成器,从而消除对外部提议网络的需求?
  • RQ3将生成模型与判别模型结合是否能在零样本指代图像分割中带来更优的分割性能?
  • RQ4生成模型中的注意力机制如何与指代表达及真实分割掩码对齐?

主要发现

  • 仅使用生成模型,该方法在三个基准数据集上的表现已与当前最先进弱监督方法相当,证明了其在无需任何训练的情况下实现零样本分割的可行性。
  • 当与判别模型(如 CLIP)结合时,Ref-Diff 显著优于现有的弱监督和零样本方法,实现了最先进性能。
  • 可视化结果表明,生成模型的注意力与指代表达的主语高度对齐,尤其当主语标记完整捕捉了文本上下文时。
  • 生成模型通过根据不同的文本标记聚焦于相关图像区域,展现出上下文理解能力,从而实现精确的定位与分割。
  • 失败案例主要源于指代表达的模糊性,例如错误地将最左侧的手识别为目标,表明仍需提升对语言模糊性的鲁棒性。
  • 尽管推理阶段计算成本较高,但该方法实现了无需训练、数据高效的分割,降低了在低资源场景下的部署门槛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。