Skip to main content
QUICK REVIEW

[论文解读] Tackling Catastrophic Forgetting and Background Shift in Continual Semantic Segmentation

Arthur Douillard, Yifu Chen|arXiv (Cornell University)|Jun 29, 2021
Domain Adaptation and Few-Shot Learning参考文献 105被引用 11
一句话总结

本文提出PLOP,一种新颖的持续语义分割方法,通过局部POD(多尺度特征蒸馏)和基于熵的伪标签化方法,解决灾难性遗忘和背景分布偏移问题,以恢复背景中旧类别像素。此外,本文提出一种内存高效的回放方法——物体回放(Object Rehearsal),在多个基准测试中实现最先进性能,显著提升长期学习能力和鲁棒性。

ABSTRACT

Deep learning approaches are nowadays ubiquitously used to tackle computer vision tasks such as semantic segmentation, requiring large datasets and substantial computational power. Continual learning for semantic segmentation (CSS) is an emerging trend that consists in updating an old model by sequentially adding new classes. However, continual learning methods are usually prone to catastrophic forgetting. This issue is further aggravated in CSS where, at each step, old classes from previous iterations are collapsed into the background. In this paper, we propose Local POD, a multi-scale pooling distillation scheme that preserves long- and short-range spatial relationships at feature level. Furthermore, we design an entropy-based pseudo-labelling of the background w.r.t. classes predicted by the old model to deal with background shift and avoid catastrophic forgetting of the old classes. Finally, we introduce a novel rehearsal method that is particularly suited for segmentation. Our approach, called PLOP, significantly outperforms state-of-the-art methods in existing CSS scenarios, as well as in newly proposed challenging benchmarks.

研究动机与目标

  • 解决持续语义分割(CSS)中的灾难性遗忘问题,即模型在学习新类别时迅速遗忘先前学习过的类别。
  • 缓解背景分布偏移这一CSS中的独特挑战,即背景类别逐渐包含旧类别和未来类别,从而扭曲模型学习过程。
  • 设计一种适用于像素级分割任务的内存高效回放策略,克服完整图像回放带来的高存储成本。
  • 通过引入余弦归一化和改进的批量归一化等结构修改,提升持续学习中的长期性能。
  • 提出新的评估基准,以更准确评估持续语义分割中的长期泛化能力、类别顺序敏感性及域偏移问题。

提出的方法

  • 提出局部POD(Local POD),一种多尺度池化蒸馏机制,用于在旧模型和新模型版本之间保留特征图中的长距离和短距离空间关系。
  • 设计基于熵的伪标签损失,以识别并恢复背景中属于旧类别的像素,减少真实背景与先前学习类别之间的混淆。
  • 提出PLOPLong,即PLOP的增强版本,引入分类器的余弦归一化和改进的批量归一化,以提升对任务间统计分布偏移的鲁棒性。
  • 开发物体回放(Object Rehearsal),一种新型回放方法,仅存储并重放过去数据中分割出的物体,相比完整图像回放显著降低内存使用。
  • 将伪标签化与回放学习作为互补策略:伪标签化处理背景中类别模糊性,而回放提供直接的经验重放。
  • 通过特征层面的约束进行知识蒸馏,以在持续学习步骤中保持模型一致性,平衡模型的可塑性与稳定性。

实验结果

研究问题

  • RQ1如何在不存储完整历史数据集的前提下,有效缓解持续语义分割中的灾难性遗忘?
  • RQ2背景分布偏移(即背景类别包含旧类别和未来类别)在多大程度上加剧遗忘?如何纠正这一问题?
  • RQ3回放学习能否有效适配于语义分割任务?何种形式的回放最为内存高效,同时保持性能?
  • RQ4余弦归一化和批量归一化改进等结构修改在多大程度上提升持续学习场景下的长期性能?
  • RQ5为公平评估持续语义分割中的长期泛化能力与鲁棒性,需要哪些新的基准?

主要发现

  • PLOP在所有标准CSS基准测试中均达到最先进性能,mIoU指标显著优于现有方法。
  • PLOPLong与物体回放结合后,分割掩码近乎完美,边界更清晰,精度高于所有基线模型,尤其在长期场景中表现突出。
  • 物体回放相比完整图像回放将内存使用降低高达90%,同时保持或提升性能,具备实际部署可行性。
  • 基于熵的伪标签损失能有效恢复背景中属于旧类别的像素,即使在当前数据中未显式包含旧类别时,也能显著减少遗忘。
  • 消融实验表明,局部POD和伪标签损失均对性能提升有显著贡献,二者结合效果最为稳健。
  • 所提出的基准揭示了类别顺序和域偏移对模型性能有显著影响,而PLOPLong结合物体回放在这些条件下展现出更强的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。