[论文解读] SOGNet: Scene Overlap Graph Network for Panoptic Segmentation
SOGNet 提出了一种用于全景分割的可微分场景重叠图网络,通过基于类别、几何和外观特征的关系嵌入,显式建模并解决物体重叠问题。通过引入可微分的重叠解析模块并利用全景监督,SOGNet 在 COCO 和 Cityscapes 上实现了最先进性能,并凭借使用 ResNet-101-FPN 主干网络在 COCO test-dev 上取得 47.8 PQ 的成绩,荣获 COCO 2019 创新奖。
The panoptic segmentation task requires a unified result from semantic and instance segmentation outputs that may contain overlaps. However, current studies widely ignore modeling overlaps. In this study, we aim to model overlap relations among instances and resolve them for panoptic segmentation. Inspired by scene graph representation, we formulate the overlapping problem as a simplified case, named scene overlap graph. We leverage each object's category, geometry and appearance features to perform relational embedding, and output a relation matrix that encodes overlap relations. In order to overcome the lack of supervision, we introduce a differentiable module to resolve the overlap between any pair of instances. The mask logits after removing overlaps are fed into per-pixel instance \verb|id| classification, which leverages the panoptic supervision to assist in the modeling of overlap relations. Besides, we generate an approximate ground truth of overlap relations as the weak supervision, to quantify the accuracy of overlap relations predicted by our method. Experiments on COCO and Cityscapes demonstrate that our method is able to accurately predict overlap relations, and outperform the state-of-the-art performance for panoptic segmentation. Our method also won the Innovation Award in COCO 2019 challenge.
研究动机与目标
- 显式建模并解决全景分割中实例之间重叠区域的问题,而这些问题在现有方法中通常被忽略。
- 通过可微分的重叠解析模块,利用像素级全景监督来弥补重叠关系缺乏直接监督的问题。
- 将重叠问题形式化为包含三种关系类型的场景重叠图:无重叠、覆盖(主体)和被覆盖(客体)。
- 通过近似真实重叠关系生成弱监督,以量化预测关系的准确性。
- 通过将关系推理整合到端到端训练框架中,实现全景分割的最先进性能。
提出的方法
- SOGNet 使用共享主干网络(ResNet-FPN)进行语义与实例分割的联合预测,随后通过关系嵌入模块,利用类别、几何和外观特征编码重叠关系。
- 关系嵌入输出的关系矩阵显式表示对象对之间的重叠关系,包含三种类型:无重叠、主体(覆盖者)和客体(被覆盖者)。
- 重叠解析模块通过修改掩码 logits,可微分地解决任意两个实例之间的重叠,从而实现端到端训练并结合全景监督。
- 全景头在解析后的掩码 logits 上进行像素级实例 ID 分类,利用全景标注监督整个网络。
- 通过生成重叠关系的近似真实标签,提供弱监督并评估预测关系的准确性。
- 模型通过联合优化分割、关系嵌入和重叠解析组件,实现端到端训练。
实验结果
研究问题
- RQ1对物体之间重叠关系进行显式建模是否能提升全景分割性能?
- RQ2在全景数据集中缺乏关系标注的情况下,如何在无直接监督的条件下学习重叠关系?
- RQ3可微分的重叠解析模块是否能有效支持全景分割中关系推理的端到端训练?
- RQ4场景重叠图表示在复杂重叠场景中能在多大程度上提升泛化能力和精度?
- RQ5在定量性能和显式关系预测方面,SOGNet 与最先进方法相比表现如何?
主要发现
- SOGNet 在使用 ResNet-101-FPN 主干网络的情况下,在 COCO test-dev 数据集上取得了 47.8 PQ 的成绩,超越了 COCO 2019 挑战赛中所有单模型方法。
- 在相同主干网络下,SOGNet 相较于 AUNet 提升 PQ 1.3%,相较于 UPSNet 提升 1.2%,尽管使用了更小的主干网络,仍展现出卓越性能。
- 在 Cityscapes 数据集上,SOGNet 达到 60.0 PQ,领先 TASCNet 和 UPSNet 0.7%,展现出对多样化场景的强大泛化能力。
- 消融实验表明,关系嵌入模块与重叠解析模块均显著提升性能,其中全景头(PH2)优于 PH1。
- SOGNet 是唯一显式预测并解析重叠关系的方法,可视化结果表明其在处理如杯子放在桌上的重叠物体时表现更优。
- 通过近似真实标签对模型预测的关系进行了定量验证,确认了其在关系预测上的高准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。