[论文解读] Prototype-based Incremental Few-Shot Semantic Segmentation
本文提出了增量少样本语义分割(iFSS),这是一个新任务,通过仅使用少量标注图像并在不访问旧数据的情况下,扩展预训练分割模型以支持新类别。所提出的PIFS方法结合了原型学习进行分类器初始化、知识蒸馏以防止遗忘和过拟合,以及批量归一化(batch-renorm)以处理非独立同分布(non-i.i.d.)的少样本数据,在多个基准测试中实现了最先进性能。
Semantic segmentation models have two fundamental weaknesses: i) they require large training sets with costly pixel-level annotations, and ii) they have a static output space, constrained to the classes of the training set. Toward addressing both problems, we introduce a new task, Incremental Few-Shot Segmentation (iFSS). The goal of iFSS is to extend a pretrained segmentation model with new classes from few annotated images and without access to old training data. To overcome the limitations of existing models iniFSS, we propose Prototype-based Incremental Few-Shot Segmentation (PIFS) that couples prototype learning and knowledge distillation. PIFS exploits prototypes to initialize the classifiers of new classes, fine-tuning the network to refine its features representation. We design a prototype-based distillation loss on the scores of both old and new class prototypes to avoid overfitting and forgetting, and batch-renormalization to cope with non-i.i.d.few-shot data. We create an extensive benchmark for iFSS showing that PIFS outperforms several few-shot and incremental learning methods in all scenarios.
研究动机与目标
- 为解决现有语义分割模型依赖大规模标注数据集且无法在不重新训练的情况下适应新类别的问题。
- 定义一种新的实用学习场景——增量少样本分割(iFSS),即模型在无历史数据访问条件下,从少量图像中学习新类别。
- 开发一种方法,在最小监督下有效适应新类别的同时避免灾难性遗忘。
- 设计一个全面的iFSS基准,以在真实条件下评估和比较现有及新提出的方法。
提出的方法
- PIFS利用新类别特征的原型初始化分类器权重,从而在少样本学习过程中实现有效的端到端微调。
- 提出一种基于原型的知识蒸馏损失,同时正则化旧类别与新类别的得分,从而同步减少遗忘与过拟合。
- 采用批量归一化(batch-renorm)而非标准批量归一化,以稳定在非独立同分布(non-i.i.d.)少样本数据分布上的训练过程。
- 从支持图像中计算原型,并将其作为类别特定嵌入,以指导特征学习与分类。
- 在学生网络(在新类别上微调)与教师网络(在基础类别上预训练)之间应用知识蒸馏,以原型作为软目标。
- 通过按顺序添加新类别,该框架支持增量学习,同时保持对先前学习类别的性能。
实验结果
研究问题
- RQ1能否仅使用少量标注图像且不访问先前训练数据,有效扩展分割模型以支持新类别?
- RQ2当旧类别在训练期间不可用时,如何在少样本语义分割中缓解灾难性遗忘?
- RQ3在语义分割中,针对非独立同分布(non-i.i.i.d.)少样本数据分布,哪些训练技术最为有效?
- RQ4基于原型的初始化结合知识蒸馏是否能提升少样本泛化能力与增量学习性能?
- RQ5背景偏移(即旧类别像素被标记为背景)如何影响模型性能,又该如何应对?
主要发现
- PIFS在VOC与COCO基准测试的所有iFSS设置中均实现了最高的平均交并比(mIoU),优于现有增量学习与少样本学习方法。
- 在单步设置下存在背景偏移时,PIFS*(采用修正交叉熵损失)在VOC上比最佳IL方法高出2.7%(调和平均mIoU),在COCO上高出4%。
- PIFS*在VOC上将mIoU-B(背景类别)提升1.7%,在COCO上提升4.7%相较于PIFS,证明了建模背景偏移的优势。
- 与标准批量归一化相比,使用batch-renorm显著提升了性能,后者在非独立同分布(non-i.i.d.)少样本数据上表现更差。
- 仅依赖新类别原型的方法(如DWI)在VOC上平均HM得分比PIFS低5.7%,在COCO上低2.5%,表明联合蒸馏的优势。
- SPN无法处理背景偏移,mIoU-B得分较差,而PIFS*在VOC上领先6%,在COCO上领先2.7%,证实了正确建模背景的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。