[论文解读] Weakly-supervised segmentation of referring expressions
该论文提出TSEG,一种基于Transformer的弱监督指代表达分割方法,通过仅使用图像级指代表达作为监督信号,无需像素级标注即可学习分割掩码。通过采用多标签区域分配机制将文本与视觉区域对齐,TSEG在PhraseCut和RefCOCO数据集上均取得优异性能,在Pascal VOC上的零样本迁移mIoU达到48.5,展现出在开放词汇分割任务中的良好可扩展性。
Visual grounding localizes regions (boxes or segments) in the image corresponding to given referring expressions. In this work we address image segmentation from referring expressions, a problem that has so far only been addressed in a fully-supervised setting. A fully-supervised setup, however, requires pixel-wise supervision and is hard to scale given the expense of manual annotation. We therefore introduce a new task of weakly-supervised image segmentation from referring expressions and propose Text grounded semantic SEGgmentation (TSEG) that learns segmentation masks directly from image-level referring expressions without pixel-level annotations. Our transformer-based method computes patch-text similarities and guides the classification objective during training with a new multi-label patch assignment mechanism. The resulting visual grounding model segments image regions corresponding to given natural language expressions. Our approach TSEG demonstrates promising results for weakly-supervised referring expression segmentation on the challenging PhraseCut and RefCOCO datasets. TSEG also shows competitive performance when evaluated in a zero-shot setting for semantic segmentation on Pascal VOC.
研究动机与目标
- 解决全监督指代表达分割中的可扩展性瓶颈,后者需要昂贵的像素级标注。
- 提出一种新任务:仅使用图像级指代表达作为监督信号,实现弱监督指代表达分割。
- 克服在开放词汇、组合性指代表达场景下弱监督分割的挑战,其中图像级标签不完整,且词汇表未预先定义。
- 设计一种方法,使其在无需在目标数据集上微调的情况下,即可泛化至零样本语义分割。
提出的方法
- 提出文本对齐语义分割(TSEG),一种基于Transformer的架构,扩展了Segmenter以适用于指代表达分割任务。
- 引入多标签区域分配(MPA),一种全局加权池化机制,用于计算区域与文本之间的相似度,并将多个文本标签分配给图像区域。
- 利用区域-文本相似度得分指导训练过程中的分类目标,实现从图像级监督信号端到端的模型学习。
- 采用视觉Transformer主干网络提取区域级特征,使用文本编码器处理指代表达。
- 通过多标签分类头预测每个指代表达的分割掩码,利用MPA优化后的区域特征。
- 通过将Pascal VOC类别名称编码为文本提示并使用置信度阈值筛选预测掩码,实现零样本迁移。
实验结果
研究问题
- RQ1视觉-语言模型是否能仅从图像级指代表达中学习到准确的分割掩码,而无需任何像素级监督?
- RQ2在弱监督设置下,所提出的多标签区域分配机制相比全局最大池化或全局平均池化,如何提升分割精度?
- RQ3在Pascal VOC等开放词汇数据集上,基于弱监督指代表达预训练的模型在零样本语义分割任务上的泛化能力有多强?
- RQ4在处理模糊或细粒度描述(如“更深的巧克力色泰迪熊”)时,弱监督指代表达分割存在哪些局限性?
- RQ5标签工程是否能缓解在零样本迁移中“person”等低频类别上的性能下降?
主要发现
- TSEG仅使用图像级指代表达,在PhraseCut测试集上达到44.8 mIoU,显著优于GAP、GMP和SPA等基线方法。
- 在RefCOCO数据集上,TSEG在弱监督设置下取得66.00 mIoU,超过该划分上最佳全监督方法VLT。
- 在全监督设置下,TSEG在PhraseCut上达到49.6 mIoU,接近在更大规模数据集和更高分辨率图像上预训练的MDETR(53.1 mIoU)。
- 在Pascal VOC 2012的零样本评估中,TSEG实现48.5 mIoU,优于SPA基线(43.5 mIoU),展现出对未见类别的强大泛化能力。
- 通过应用标签工程(如使用“rider”或“woman”替代“person”),TSEG将零样本mIoU提升至50.3,接近在3000万张图像-文本对上预训练的GroupViT(51.2 mIoU)。
- “person”类别上的失败案例凸显了更具体文本提示的必要性,表明模型偏差部分源于训练数据中的标注模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。