Skip to main content
QUICK REVIEW

[论文解读] Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers

Lei Ke, Yu‐Wing Tai|arXiv (Cornell University)|Mar 23, 2021
Advanced Neural Network Applications参考文献 63被引用 8
一句话总结

该论文提出了一种新型两阶段实例分割框架——双层卷积网络(BCNet),通过将重叠物体显式分解为两个独立层级(遮挡物,即上层;被遮挡物,即下层),显式建模遮挡关系。通过级联结构中的两个图卷积网络(GCNs)联合回归两个物体的掩码与边界,BCNet将遮挡边界与真实物体轮廓解耦,从而在COCO和KINS数据集上取得最先进性能,尤其在严重遮挡场景下表现优异。

ABSTRACT

Segmenting highly-overlapping objects is challenging, because typically no distinction is made between real object contours and occlusion boundaries. Unlike previous two-stage instance segmentation methods, we model image formation as composition of two overlapping layers, and propose Bilayer Convolutional Network (BCNet), where the top GCN layer detects the occluding objects (occluder) and the bottom GCN layer infers partially occluded instance (occludee). The explicit modeling of occlusion relationship with bilayer structure naturally decouples the boundaries of both the occluding and occluded instances, and considers the interaction between them during mask regression. We validate the efficacy of bilayer decoupling on both one-stage and two-stage object detectors with different backbones and network layer choices. Despite its simplicity, extensive experiments on COCO and KINS show that our occlusion-aware BCNet achieves large and consistent performance gain especially for heavy occlusion cases. Code is available at https://github.com/lkeab/BCNet.

研究动机与目标

  • 解决高度重叠物体场景下的实例分割挑战,传统方法常将遮挡边界与真实物体轮廓混淆。
  • 克服现有两阶段实例分割框架(如Mask R-CNN)的局限性,后者将被遮挡区域视为目标物体的一部分,且无法建模遮挡物与被遮挡物之间的相互作用。
  • 通过显式建模每个ROI内的遮挡关系,提升在可见(modal)和完整(amodal)实例分割任务上的性能。
  • 通过将遮挡物与被遮挡物预测分离至独立的GCN层,实现更可解释的分割输出。
  • 贡献一个大规模遮挡感知数据集,包含遮挡物与被遮挡物的完整真实轮廓,以支持未来遮挡处理研究。

提出的方法

  • 提出双层结构:上层GCN负责检测遮挡物(occluder),下层GCN在相同ROI内回归部分被遮挡的实例(occludee)。
  • 在两层中均使用图卷积网络(GCNs)以建模长距离、非局部的像素关系,实现遮挡区域间的信息传播。
  • 采用级联GCN架构,使两层联合回归掩码与边界,并显式建模遮挡物与被遮挡物之间的交互。
  • 通过将遮挡区域与被遮挡区域视为独立层级,将遮挡边界预测与真实物体边界解耦,减少边界混淆。
  • 将BCNet头与多种目标检测器(如Faster R-CNN、FCOS)及主干网络(ResNet-50、ResNet-101)结合,证明其在不同架构间的泛化能力。
  • 在新构建的遮挡感知数据集上进行训练,该数据集源自COCO,并引入合成遮挡增强,以提升对严重遮挡的鲁棒性。

实验结果

研究问题

  • RQ1对重叠物体之间的遮挡关系进行显式建模,是否能提升实例分割性能,尤其是在严重遮挡场景下?
  • RQ2将遮挡物与被遮挡物预测解耦至独立层级,是否能相比单层掩码头产生更准确且可解释性更强的掩码预测?
  • RQ3与专用的完整形状分割方法相比,BCNet在完整实例分割(预测完整物体形状)上的表现如何?
  • RQ4所提出的双层GCN架构在不同目标检测器与主干网络上的泛化能力如何?
  • RQ5合成遮挡数据增强是否能显著提升模型对真实世界遮挡实例的泛化能力?

主要发现

  • 在使用Faster R-CNN与ResNet-101的设置下,BCNet在COCO上达到39.8 AP,优于Mask Scoring R-CNN(38.3 AP)与HTC(39.7 AP)。
  • 在COCO-OCC(严重遮挡图像)划分上,经合成遮挡数据微调后,BCNet达到32.89 AP,超过Mask Scoring R-CNN的30.32 AP。
  • 在COCOA上的完整分割任务中,BCNet生成的形状补全比AmodalMask与ORCNN更合理,错误更少,定性对比显示其优势明显。
  • 在KINS数据集中,BCNet在相邻车辆的边界预测上优于Mask R-CNN + ASN,尤其在复杂遮挡场景下表现更优。
  • 双层GCN设计使预测更具可解释性:可视化显示GCN-1检测遮挡物,GCN-2回归被遮挡物,两者的热力图模式截然不同。
  • BCNet在不同主干网络(ResNet-50、ResNet-101)与检测器(Faster R-CNN、FCOS)上均持续提升性能,展现出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。