[论文解读] Integrative Few-Shot Learning for Classification and Segmentation
本文提出了整合性 few-shot learning(iFSL)用于 few-shot 分类与分割(FS-CS),这是一种统一的任务,通过少量支持样本联合预测类别存在性与前景掩码。所提出的注意力压缩网络(ASNet)利用语义相关性和全局自注意力机制生成准确、类别感知的前景图,在 FS-CS 和标准 few-shot 分割基准上均达到最先进性能。
We introduce the integrative task of few-shot classification and segmentation (FS-CS) that aims to both classify and segment target objects in a query image when the target classes are given with a few examples. This task combines two conventional few-shot learning problems, few-shot classification and segmentation. FS-CS generalizes them to more realistic episodes with arbitrary image pairs, where each target class may or may not be present in the query. To address the task, we propose the integrative few-shot learning (iFSL) framework for FS-CS, which trains a learner to construct class-wise foreground maps for multi-label classification and pixel-wise segmentation. We also develop an effective iFSL model, attentive squeeze network (ASNet), that leverages deep semantic correlation and global self-attention to produce reliable foreground maps. In experiments, the proposed method shows promising performance on the FS-CS task and also achieves the state of the art on standard few-shot segmentation benchmarks.
研究动机与目标
- 为解决传统 few-shot 学习的局限性,将分类与分割统一为一个更贴近现实的单一任务。
- 开发一种能够处理多标签和背景感知预测的框架,包括目标类别在查询中可能不存在的情况。
- 设计一种模型,通过共享表示学习生成可靠、类别区分的前景图。
- 在涉及极小、非显著或多个物体的 few-shot 场景中提升泛化能力与鲁棒性。
- 验证 FS-CS 模型在标准 few-shot 分类与分割任务中的可迁移性。
提出的方法
- 提出 iFSL 框架,通过在两个任务间共享类别特定的前景图,联合学习分类与分割。
- 设计注意力压缩网络(ASNet),计算查询与支持特征之间的语义相关性张量。
- 应用步幅全局自注意力机制,将相关性张量转换为精确的前景图。
- 使用多层级特征表示以增强语义理解与空间定位能力。
- 端到端训练模型,同时使用类别标签与分割标注进行联合优化。
- 采用双头预测头,分别预测二值类别存在性与像素级分割掩码。
实验结果
研究问题
- RQ1在包含类别缺失或多个目标类别的现实条件下,统一的 few-shot 学习框架能否有效结合分类与分割?
- RQ2将分类与分割联合学习相比孤立任务学习,能否显著提升鲁棒性与准确性?
- RQ3所提出的 ASNet 模型在标准 few-shot 分割基准上的泛化能力如何?
- RQ4在整合性 FS-CS 任务上进行训练,是否能通过迁移学习提升在下游 FS-C 与 FS-S 任务上的性能?
- RQ5在具有挑战性的 few-shot 场景中,全局自注意力与语义相关性如何提升前景图质量?
主要发现
- ASNet 在提出的 FS-CS 基准上达到最先进性能,在使用 ResNet50 的 1-way 1-shot COCO-20i 上实现 42.2% mIoU 与 42.2% 分类精确率。
- 在 1-way 5-shot 设置下,ASNet 实现 47.9% mIoU 与 47.9% 分类精确率,两项指标均优于先前方法。
- 在使用 ResNet101 的 1-way 1-shot 设置下,ASNet 实现 49.5% mIoU 与 49.5% 分类精确率,展现出强大的泛化能力。
- ASNet 显著优于现有 FS-S 模型(如 HSNet 与 CMN),在标准 few-shot 分割基准上实现 72.7% FBIoU(1-way 5-shot,ResNet101)。
- 定性结果表明,即使目标物体极小、非显著或缺失,ASNet 仍能正确分割目标,而标准 FS-S 模型会错误地分割显著但无关的物体。
- 迁移学习实验表明,FS-CS 训练的模型在 FS-C 与 FS-S 任务上均具有良好的泛化能力,验证了任务间的可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。