[论文解读] Pin the Memory: Learning to Generalize Semantic Segmentation
本文提出 Pin the Memory,一种基于记忆的元学习框架,用于语义分割中的领域泛化。通过记忆模块学习领域无关的类别知识,并结合记忆差异损失与特征凝聚损失进行优化,该方法在无需微调的情况下实现了对未见领域的最先进泛化性能,优于现有领域泛化方法,并达到多源域自适应的性能水平。
The rise of deep neural networks has led to several breakthroughs for semantic segmentation. In spite of this, a model trained on source domain often fails to work properly in new challenging domains, that is directly concerned with the generalization capability of the model. In this paper, we present a novel memory-guided domain generalization method for semantic segmentation based on meta-learning framework. Especially, our method abstracts the conceptual knowledge of semantic classes into categorical memory which is constant beyond the domains. Upon the meta-learning concept, we repeatedly train memory-guided networks and simulate virtual test to 1) learn how to memorize a domain-agnostic and distinct information of classes and 2) offer an externally settled memory as a class-guidance to reduce the ambiguity of representation in the test data of arbitrary unseen domain. To this end, we also propose memory divergence and feature cohesion losses, which encourage to learn memory reading and update processes for category-aware domain generalization. Extensive experiments for semantic segmentation demonstrate the superior generalization capability of our method over state-of-the-art works on various benchmarks.
研究动机与目标
- 为解决语义分割中的领域偏移问题,即模型在因分布偏移而无法适应的未见领域上表现不佳。
- 通过学习以类别记忆形式抽象出的领域无关、类别特定知识,提升泛化能力。
- 实现在无需微调或重新训练的前提下,对任意未见领域的零样本适应。
- 通过记忆引导的元学习和互补损失函数,增强表示的鲁棒性。
提出的方法
- 该方法采用元学习框架,将源域数据划分为元训练集和元测试集,以在训练过程中模拟领域偏移。
- 可学习的记忆模块存储语义类别的领域无关原型,作为在未见领域推理时的外部引导。
- 在元测试阶段,通过专用网络更新记忆,使模型能够学习到稳健的记忆读取与更新策略。
- 引入两种新型损失:记忆差异损失以增强记忆的可分性,特征凝聚损失以促进领域不变特征。
- 框架采用课程学习方式模拟未见领域的条件,联合训练编码器与记忆更新网络,以应对数据分布不匹配的问题。
- 推理阶段,模型利用预先学习的记忆来引导特征表示,从而降低在未见领域中的歧义性。

实验结果
研究问题
- RQ1一个存储领域无关类别知识的记忆模块,是否能提升语义分割在未见领域上的泛化性能?
- RQ2通过模拟领域偏移的元学习,如何增强记忆引导特征表示的鲁棒性?
- RQ3记忆差异损失与特征凝聚损失对领域泛化性能的贡献分别是什么?
- RQ4在未访问目标领域数据的前提下,记忆引导的元学习能否实现与多源域自适应相当的性能?
主要发现
- 所提方法在多个基准测试(包括 Cityscapes、COCO-Stuff 和 BDD100K)的领域泛化设置下,实现了最先进性能。
- 结合记忆差异损失与特征凝聚损失后,该方法在 Cityscapes 上相比 MLDG 提升 2.1% mIoU,在 COCO-Stuff 上提升 1.8%。
- 在所有数据集上,该方法均优于 IBN-Net、RobustNet 和 MLDG 等强基线模型,展现出卓越的泛化能力。
- t-SNE 可视化结果表明,使用记忆引导方法后,未见领域中的特征更易分离且歧义更小。
- 该方法保持了高效的推理速度(13.56ms),仅带来少量参数增加(45.22M)和 FLOPs 增加(277.69),体现出良好的成本效益。
- 消融实验表明,记忆更新与元学习均不可或缺,任一模块被移除后性能显著下降。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。