[论文解读] Dynamic-structured Semantic Propagation Network
本文提出动态结构化语义传播网络(DSSPN),一种新颖的语义分割框架,通过动态结构化的神经元图显式建模语义概念层次结构,其中每张图像仅激活相关神经元。通过使用密集语义增强模块,从所有祖先神经元传播知识,DSSPN在四个基准数据集上实现最先进性能,并支持在多样化数据集上统一训练,超越了特定任务微调的性能表现。
Semantic concept hierarchy is still under-explored for semantic segmentation due to the inefficiency and complicated optimization of incorporating structural inference into dense prediction. This lack of modeling semantic correlations also makes prior works must tune highly-specified models for each task due to the label discrepancy across datasets. It severely limits the generalization capability of segmentation models for open set concept vocabulary and annotation utilization. In this paper, we propose a Dynamic-Structured Semantic Propagation Network (DSSPN) that builds a semantic neuron graph by explicitly incorporating the semantic concept hierarchy into network construction. Each neuron represents the instantiated module for recognizing a specific type of entity such as a super-class (e.g. food) or a specific concept (e.g. pizza). During training, DSSPN performs the dynamic-structured neuron computation graph by only activating a sub-graph of neurons for each image in a principled way. A dense semantic-enhanced neural block is proposed to propagate the learned knowledge of all ancestor neurons into each fine-grained child neuron for feature evolving. Another merit of such semantic explainable structure is the ability of learning a unified model concurrently on diverse datasets by selectively activating different neuron sub-graphs for each annotation at each step. Extensive experiments on four public semantic segmentation datasets (i.e. ADE20K, COCO-Stuff, Cityscape and Mapillary) demonstrate the superiority of our DSSPN over state-of-the-art segmentation models. Moreoever, we demonstrate a universal segmentation model that is jointly trained on diverse datasets can surpass the performance of the common fine-tuning scheme for exploiting multiple domain knowledge.
研究动机与目标
- 解决现有语义分割模型中对语义概念层次结构缺乏显式建模的问题。
- 克服因数据集间标签差异导致的特定任务模型局限性。
- 实现一个可泛化于具有不同标签词汇的多样化数据集的统一分割模型。
- 通过动态、结构化的网络计算,利用层次化语义相关性提升特征表示能力。
- 通过仅激活每张图像相关的语义神经元子图,实现高效与高性能。
提出的方法
- 构建一个语义神经元图,其中每个神经元对应预定义概念层次结构中的特定概念(如“食物”或“披萨”)。
- 在训练和推理过程中,通过仅激活与目标标签相关的神经元子图,实现动态结构化传播。
- 引入一种密集语义增强神经块,融合所有祖先神经元的特征,以演化子神经元的表示,灵感源自DenseNet。
- 使用逐像素Sigmoid与二元交叉熵损失,避免类别竞争,支持在标签部分重叠的数据集间进行联合学习。
- 在测试阶段采用分层预测机制,通过在层次结构的每一层聚焦区分易混淆概念,实现高效学习。
- 通过将多个祖先的特征通过求和方式组合,支持灵活的图结构,包括多祖先节点。
实验结果
研究问题
- RQ1显式整合语义概念层次结构是否能提升语义分割在多样化数据集上的泛化能力?
- RQ2基于语义层次的动态子图激活如何影响模型效率与性能?
- RQ3与仅使用父节点或基于求和的聚合方式相比,从所有祖先神经元进行密集特征传播是否能提升特征表示?
- RQ4在多个数据集上联合训练的单一统一模型是否能超越特定任务微调模型的性能?
- RQ5在开放词汇、多数据集训练中,损失函数选择(Sigmoid与Softmax)对性能有何影响?
主要发现
- DSSPN在四个公开基准数据集(ADE20K、COCO-Stuff、Cityscapes和Mapillary)上均达到最先进性能。
- 在多个数据集上联合训练的统一DSSPN模型,其性能超越了标准微调方案在利用多领域知识方面的表现。
- 使用Sigmoid损失与二元交叉熵损失显著优于Softmax损失,尤其在数据集间存在部分标签重叠的场景下。
- 尽管总参数量更多,但动态结构化传播机制通过仅激活每张图像相关的神经元子图,有效降低了计算与内存开销。
- 采用特征拼接的密集语义增强模块优于使用特征求和或无密集连接的版本,在保持效率的同时提升了性能。
- 中等大小的隐藏特征图尺寸(m=48)已足够捕捉关键特征,表明具有良好的参数效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。