Skip to main content
QUICK REVIEW

[论文解读] Scaling up Multi-domain Semantic Segmentation with Sentence Embeddings

Wei Yin, Yifan Liu|arXiv (Cornell University)|Feb 4, 2022
Domain Adaptation and Few-Shot Learning被引用 7
一句话总结

该论文提出了一种零样本语义分割方法,将类别标签替换为来自维基百科的句子嵌入,从而在无需人工标签对齐的情况下自动合并多领域数据集。通过在9个不同数据集的超过200万张图像上进行训练,并采用异质损失函数,该模型在7个基准数据集上实现了零样本和微调设置下的最先进性能,包括在PASCAL-Context上达到65%的mIoU,以及在COCO实例分割上达到45.5%的AP。

ABSTRACT

We propose an approach to semantic segmentation that achieves state-of-the-art supervised performance when applied in a zero-shot setting. It thus achieves results equivalent to those of the supervised methods, on each of the major semantic segmentation datasets, without training on those datasets. This is achieved by replacing each class label with a vector-valued embedding of a short paragraph that describes the class. The generality and simplicity of this approach enables merging multiple datasets from different domains, each with varying class labels and semantics. The resulting merged semantic segmentation dataset of over 2 Million images enables training a model that achieves performance equal to that of state-of-the-art supervised methods on 7 benchmark datasets, despite not using any images therefrom. By fine-tuning the model on standard semantic segmentation datasets, we also achieve a significant improvement over the state-of-the-art supervised segmentation on NYUD-V2 and PASCAL-context at 60% and 65% mIoU, respectively. Based on the closeness of language embeddings, our method can even segment unseen labels. Extensive experiments demonstrate strong generalization to unseen image domains and unseen labels, and that the method enables impressive performance improvements in downstream applications, including depth estimation and instance segmentation.

研究动机与目标

  • 克服在固定类别集合的单领域数据集上训练的监督语义分割模型的局限性。
  • 在无需微调或人工标注的情况下,实现对未见类别和图像领域的零样本泛化。
  • 自动合并具有冲突标签分类体系的多个异构语义分割数据集。
  • 通过伪标签数据提升下游任务(如深度估计和实例分割)的性能。
  • 证明基于语言的标签嵌入可作为传统类别标签的可扩展、通用替代方案。

提出的方法

  • 将每个类别标签替换为从维基百科检索到的描述性句子的稠密向量嵌入。
  • 使用CLIP的文本编码器生成句子嵌入,避免在嵌入生成过程中使用图像模态。
  • 在由9个不同数据集组成的合并数据集上训练分割模型,利用超过200万张图像并保持一致的语义标签。
  • 引入一种异质损失函数,以有效利用弱标注数据集(如Objects365、OpenImages)和噪声标注。
  • 通过计算新类别描述的嵌入并匹配到模型的嵌入空间,实现在推理阶段的零样本推理。
  • 通过在推理或训练过程中将语言嵌入注入特征图,将学习到的表示迁移到下游任务。

实验结果

研究问题

  • RQ1句子嵌入能否替代传统类别标签,实现在多样化领域间的零样本语义分割?
  • RQ2使用句子嵌入合并多个数据集是否能提升在未见数据集上的泛化能力和性能?
  • RQ3该模型能否泛化到训练数据集中均未出现过的未见类别?
  • RQ4所提出的异质损失在利用弱标注和噪声数据集方面的有效性如何?
  • RQ5该方法在提升深度估计和实例分割等下游任务性能方面的程度如何?

主要发现

  • 在NYUD-V2上,模型在完全监督微调设置下达到60%的mIoU,在PASCAL-Context上达到65%的mIoU,超越了之前的最先进水平。
  • 在7个跨领域基准数据集上,该模型在未使用任何目标数据集训练图像的情况下,实现了最先进水平的零样本性能。
  • 该方法能够实现对“鸭子”和“鹿”等此前未见标签的零样本分割,如定性示例所示。
  • 当在COCO上使用Objects365的伪标签进行微调时,实例分割性能提升约4% AP,即使仅使用COCO数据的50%,也优于基线CondInst模型。
  • 当使用基于句子嵌入生成的伪语义标签时,单目深度估计在9个零样本数据集上均表现出一致的性能提升。
  • 句子嵌入的相似性矩阵显示其语义聚类效果优于词嵌入,证实了更优的语义对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。