[论文解读] Concept Mask: Large-Scale Segmentation from Semantic Concepts
本文提出 Concept Mask,一种用于大规模图像分割的弱监督与半监督框架,将分割任务视为以概念为中心的任务,从而实现在不同对象、部件、物质和属性之间的零样本与少样本泛化。通过在四个数据集中分三阶段训练,结合图像级、边界框和像素级标注,该方法在全监督概念上达到最先进性能,并有效泛化至未见及弱监督概念。
Existing works on semantic segmentation typically consider a small number of labels, ranging from tens to a few hundreds. With a large number of labels, training and evaluation of such task become extremely challenging due to correlation between labels and lack of datasets with complete annotations. We formulate semantic segmentation as a problem of image segmentation given a semantic concept, and propose a novel system which can potentially handle an unlimited number of concepts, including objects, parts, stuff, and attributes. We achieve this using a weakly and semi-supervised framework leveraging multiple datasets with different levels of supervision. We first train a deep neural network on a 6M stock image dataset with only image-level labels to learn visual-semantic embedding on 18K concepts. Then, we refine and extend the embedding network to predict an attention map, using a curated dataset with bounding box annotations on 750 concepts. Finally, we train an attention-driven class agnostic segmentation network using an 80-category fully annotated dataset. We perform extensive experiments to validate that the proposed system performs competitively to the state of the art on fully supervised concepts, and is capable of producing accurate segmentations for weakly learned and unseen concepts.
研究动机与目标
- 解决层次化标签空间中概念重叠导致的标签模糊性与可扩展性挑战。
- 通过将分割表述为特定概念任务而非特定类别任务,克服大规模全标注数据集的缺乏问题。
- 利用弱监督实现对未见概念(包括对象部件、物质和属性)的零样本与少样本分割。
- 开发一种统一的增量学习框架,整合具有不同监督水平的多个数据集,避免灾难性遗忘。
- 在全监督概念上实现具有竞争力的性能,同时在不重新训练的情况下泛化至弱监督与零样本概念。
提出的方法
- 在包含 600 万张图像的股票图像数据集上训练深度神经网络,使用 18,000 个语义概念的图像级标签学习视觉-语义嵌入。
- 通过使用包含 750 个概念的精选数据集进行多任务微调,利用边界框标注优化嵌入网络,同时保留先前知识。
- 在 MS-COCO 的 80 个全标注对象类别上训练一个与类别无关的分割网络,将注意力图作为输入以引导分割。
- 采用全卷积推理流程:概念嵌入 → 粗略注意力图 → 通过注意力驱动网络生成高分辨率分割掩码。
- 采用增量学习策略,在不从头训练整个模型的前提下,整合来自多个数据集的监督信号。
- 利用注意力图实现零样本与少样本分割,通过聚焦空间相关区域,无需类别特定监督。
实验结果
研究问题
- RQ1在有限全标注类别上训练的分割模型,能否泛化至如部件、物质和属性等未见概念?
- RQ2弱监督与半监督学习框架在实现多样化语义概念的零样本分割方面效果如何?
- RQ3图像级与边界框标注在提升未全标注概念的分割性能方面有多大作用?
- RQ4将注意力图作为与类别无关的引导机制,是否优于传统类别特定边界框提议方法在部件与物质上的表现?
- RQ5模型能否在保持全监督概念高性能的同时,实现对弱监督与零样本概念的强大泛化能力?
主要发现
- 在 COCO-80 上,模型表现具有竞争力,平均 IoU 达到 0.603(对象类别)、0.625(物质)与 0.516(部件),在 Weak-Box-670 基准上表现优异。
- 在仅提供每概念 5–10 个少样本示例的 ZeroTest-10 数据集上,模型有效泛化,展现出强大的零样本分割能力。
- 尽管未显式训练过,模型仍成功分割了对象部件(如裤子、角)与物质(如树线、天空)。
- 注意力网络实现概念验证,能正确识别图像中概念的存在或缺失,如 ZeroTest-10 与 Weak-Image-50 的可视化所示。
- 与 DSS 和 Mask R-CNN 等基线模型相比,该方法在弱监督与零样本基准上表现更优,尤其在非对象概念上优势明显。
- 失败案例出现在概念视觉模糊时(如药品柜与柜子混淆),或图像级标签信息不足时(如带有鸟的鲤鱼),凸显了弱监督的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。