Skip to main content
QUICK REVIEW

[论文解读] Unifying Training and Inference for Panoptic Segmentation

Qizhu Li, Xiaojuan Qi|arXiv (Cornell University)|Jan 14, 2020
Advanced Neural Network Applications参考文献 20被引用 6
一句话总结

该论文提出了一种端到端的全景分割框架,通过可学习的轻量化实例亲和模块和可微分的全景头,统一了训练与推理过程,消除了启发式后处理。该方法在仅使用ResNet-50和边界框提示的情况下,在Cityscapes上实现了61.4 PQ的最先进性能,在COCO上实现了43.4 PQ,表现出对定位误差的鲁棒性以及在神经网络设计上的灵活性。

ABSTRACT

We present an end-to-end network to bridge the gap between training and inference pipeline for panoptic segmentation, a task that seeks to partition an image into semantic regions for "stuff" and object instances for "things". In contrast to recent works, our network exploits a parametrised, yet lightweight panoptic segmentation submodule, powered by an end-to-end learnt dense instance affinity, to capture the probability that any pair of pixels belong to the same instance. This panoptic submodule gives rise to a novel propagation mechanism for panoptic logits and enables the network to output a coherent panoptic segmentation map for both "stuff" and "thing" classes, without any post-processing. Reaping the benefits of end-to-end training, our full system sets new records on the popular street scene dataset, Cityscapes, achieving 61.4 PQ with a ResNet-50 backbone using only the fine annotations. On the challenging COCO dataset, our ResNet-50-based network also delivers state-of-the-art accuracy of 43.4 PQ. Moreover, our network flexibly works with and without object mask cues, performing competitively under both settings, which is of interest for applications with computation budgets.

研究动机与目标

  • 通过消除启发式后处理,弥合全景分割中训练与推理之间的差距。
  • 通过可微分的全景头统一语义分割与实例分割,实现端到端优化。
  • 通过数据驱动的实例亲和学习,提升对不完美定位提示(如边界框)的鲁棒性。
  • 设计一种新型全景匹配损失,直接优化全局全景质量(PQ)。
  • 在无需真实实例掩码的情况下实现高性能,从而在计算资源受限的场景中具备设计灵活性。

提出的方法

  • 引入一个参数化、轻量级的全景分割子模块,用于预测像素之间的密集成对实例亲和度。
  • 采用可微分的传播机制,基于预测的亲和度在图像上聚合全景logits,实现端到端训练与推理。
  • 采用动态势能头,以表示可变数量的全景实例,而无需固定头部数量。
  • 提出一种全景匹配损失,该损失在在线实例匹配后直接对预测的全景分割计算交叉熵损失。
  • 利用预测的亲和度纠正来自粗粒度定位提示(如边界框)的不完整预测(例如被截断的物体)。
  • 仅使用边界框或掩码标注端到端训练完整系统,无需任何后处理。

实验结果

研究问题

  • RQ1可微分的、可学习的实例亲和机制是否能在不使用启发式后处理的情况下,统一全景分割的训练与推理?
  • RQ2与使用真实检测结果训练相比,采用新型全景匹配损失进行端到端训练在性能上是否有提升?
  • RQ3当定位提示(如边界框)不准确或不完整时,模型在多大程度上能恢复完整的实例分割?
  • RQ4模型是否能在不依赖昂贵的真实实例掩码的情况下实现最先进性能?
  • RQ5所提方法如何处理语义分割与实例分割预测之间的一致性问题?

主要发现

  • 该模型仅使用精细标注和ResNet-50主干网络,在Cityscapes上实现了61.4 PQ,创下该设置下的新最先进水平。
  • 在COCO数据集上,基于ResNet-50的模型实现了43.4 PQ,创下新最先进结果。
  • 即使在缺乏对象掩码提示的情况下,模型仍表现出色,证明了其对粗粒度定位输入的鲁棒性。
  • 定性结果表明,模型通过高亲和度像素传播成功恢复了被截断的物体(如汽车),而启发式方法则会在这些区域留下空洞。
  • 消融实验表明,使用亲和模块预测检测结果进行训练的性能优于使用真实检测结果训练,证明了端到端学习的价值。
  • 全景匹配损失实现了PQ的直接优化,可微分的全景头使得无需推理时后处理的完整端到端训练成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。