[论文解读] Combinatorial Optimization for Panoptic Segmentation: A Fully Differentiable Approach
本文提出 COPS,一种用于全景分割的完全可微分框架,通过将组合优化层(具体为非对称多路切割,AMWC)整合进深度学习流程中。通过使用稳健的扰动方法对 AMWC 求解器进行梯度反向传播,模型直接优化了全景质量(PQ)度量的平滑代理损失,与更大规模架构相比,采用更简单的 ResNet-50 主干网络,在 Cityscapes 和 COCO 上实现了最先进性能。
We propose a fully differentiable architecture for simultaneous semantic and instance segmentation (a.k.a. panoptic segmentation) consisting of a convolutional neural network and an asymmetric multiway cut problem solver. The latter solves a combinatorial optimization problem that elegantly incorporates semantic and boundary predictions to produce a panoptic labeling. Our formulation allows to directly maximize a smooth surrogate of the panoptic quality metric by backpropagating the gradient through the optimization problem. Experimental evaluation shows improvement by backpropagating through the optimization problem w.r.t. comparable approaches on Cityscapes and COCO datasets. Overall, our approach shows the utility of using combinatorial optimization in tandem with deep learning in a challenging large scale real-world problem and showcases benefits and insights into training such an architecture.
研究动机与目标
- 开发一种完全可微分的全景分割架构,联合优化深度神经网络与组合后处理。
- 通过构建可微分的平滑代理损失,直接优化全景质量(PQ)度量。
- 通过扩展基于扰动的反向传播技术,实现通过组合求解器对 CNN 进行端到端训练,以实现稳健收敛。
- 证明当使用可微分优化和 PQ 意识监督时,更简单的模型可超越最先进性能。
提出的方法
- 模型使用 ResNet-50 主干网络,包含两个分支:一个用于语义分割(类别代价),另一个用于亲和力预测(边界代价)。
- 这些预测被输入非对称多路切割(AMWC)求解器,将全景标注建模为结合语义与边界证据的组合优化问题。
- 使用 PQ 度量的平滑代理作为训练损失,使梯度能够通过离散优化输出流动。
- 作者将基于扰动的反向传播方法 [64] 扩展为一种稳健变体,以在使用次优启发式 AMWC 求解器时稳定训练。
- 训练分为两个阶段:首先使用交叉熵损失进行预训练,然后使用可微分 PQ 代理损失进行微调。
- 该方法在 Cityscapes 和 COCO 上进行评估,并分析了推理时间与收敛行为。
实验结果
研究问题
- RQ1组合优化能否有效集成到用于全景分割的完全可微分深度学习流程中?
- RQ2通过次优启发式 AMWC 求解器进行反向传播,是否能带来相较于使用不可微分后处理的标准训练的性能提升?
- RQ3能否使用 PQ 度量的平滑代理来训练模型,使其直接优化最终评估指标?
- RQ4当使用可微分优化和 PQ 意识损失时,更简单的模型(如 ResNet-50)在多大程度上能超越更大规模架构?
主要发现
- 所提出的通过 AMWC 求解器进行反向传播的完全可微训练方案,在 Cityscapes 和 COCO 上相比不可微分基线方法,显著提升了全景质量(PQ)。
- 即使使用更小的主干网络且无需测试时增强,该模型仍优于最先进方法如 Panoptic-DeepLab 和 SMW。
- 使用可微分 PQ 代理损失训练,在仅 24 小时后,COCO 验证集上的 PQ 分数已优于需要 11 天训练时间且使用更大批量的基线方法。
- 稳健的反向传播扩展在使用次优求解器时提升了收敛性与稳定性,使通过离散输出实现有效优化成为可能。
- 该方法表明,当使用可微分优化时,更简单的模型也能实现最先进性能,挑战了深度网络是全景分割进展所必需的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。