[论文解读] CANet: Class-Agnostic Segmentation Networks with Iterative Refinement and Attentive Few-Shot Learning
CANet提出一个类别无关的少样本分割框架,具有一个两分支密集对比模块和一个迭代细化模块,以及一个基于注意力的k-shot融合机制,在PASCAL VOC 2012的1-shot和5-shot设置下实现了平均IoU的最先进水平,并且在边界框监督下具有鲁棒性。
Recent progress in semantic segmentation is driven by deep Convolutional Neural Networks and large-scale labeled image datasets. However, data labeling for pixel-wise segmentation is tedious and costly. Moreover, a trained model can only make predictions within a set of pre-defined classes. In this paper, we present CANet, a class-agnostic segmentation network that performs few-shot segmentation on new classes with only a few annotated images available. Our network consists of a two-branch dense comparison module which performs multi-level feature comparison between the support image and the query image, and an iterative optimization module which iteratively refines the predicted results. Furthermore, we introduce an attention mechanism to effectively fuse information from multiple support examples under the setting of k-shot learning. Experiments on PASCAL VOC 2012 show that our method achieves a mean Intersection-over-Union score of 55.4% for 1-shot segmentation and 57.1% for 5-shot segmentation, outperforming state-of-the-art methods by a large margin of 14.6% and 13.2%, respectively.
研究动机与目标
- 在类别无关的设置中,使用少量标注示例实现对未见类别的分割(少样本学习)。
- 利用多层CNN特征在支持与查询图像之间执行密集像素级对比。
- 通过迭代细化来处理同一类别内的外观变异,提升分割性能。
- 在k-shot场景中加入注意力机制,以有效融合来自多个支持样本的信息。
- 探索对支持数据使用基于边界框的弱监督,以降低标注成本。
提出的方法
- 两分支密集对比模块(DCM)使用中间层CNN特征(ResNet-50 的 block2 和 block3,带扩张)在支持与查询图像之间执行全局前景引导的密集对比。
- 对支持图像前景区域进行全局平均池化以获得全局特征向量;将其与查询特征图中的每一个位置进行拼接并对比;通过3×3卷积块进行上采样和融合。
- 迭代优化模块(IOM)通过残差连接将预测掩模输入到后续迭代中以细化预测;包含多尺度特征的ASPP。
- 训练阶段采用端到端训练并使用交叉熵损失;使用随机掩模置换(p_r)以减少IOM的过拟合;初次前向仅使用无掩模的前向传播,后续可渐进性地使用掩模。
- 用于k-shot分割的注意力机制学习对k个支持样本的权重,通过softmax归一化的注意力分数融合它们的密集对比特征。
实验结果
研究问题
- RQ1一个类别无关的分割模型是否能够在只有少量带标签样本的情况下泛化到未见类别?
- RQ2使用中间层CNN特征的密集对比方法是否比以往方法在少样本分割中有更大改进?
- RQ3迭代细化是否能提高少样本任务的分割质量,尤其是对于复杂对象形状?
- RQ4在k-shot设置中,学习到的基于注意力的多支持样本融合是否比不可学习的融合方法更有效?
- RQ5对支持集进行边界框监督是否在分割性能上没有显著损失?
主要发现
- CANet在PASCAL VOC 2012上达到1-shot 55.4%和5-shot 57.1% 的平均IoU,分别比现有方法在meanIoU上领先14.6%和13.2%。
- 迭代优化模块在PASCAL-5i上对初始CANet预测提升2.8%。
- 基于注意力的k-shot融合在少样本任务的meanIoU上显著优于特征平均、掩模平均和逻辑或融合等非学习方法。
- 带有边界框标注的支持集在监督成本方面具备与像素级标注相当的性能(Table 2上下文中为54.0%对52.0%的meanIoU),表明标签效率高。
- 在COCO数据集上,1-shot的结果通过IOM提升了4.1%的meanIoU,并且多尺度评估再带来额外提升;在5-shot中,基于注意力的融合在非学习基线中表现最好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。