[论文解读] BANet: Bidirectional Aggregation Network with Occlusion Handling for Panoptic Segmentation
BANet 提出了一种具有即插即用遮挡处理模块的双向聚合网络,用于全景分割,通过 I2S 和 S2I 路径增强实例分割与语义分割之间的特征交互,并利用低层次外观特征解决遮挡冲突。当同时使用两个模块时,在 COCO 上实现了 59.3% 的 PQ,相比 ResNet-101-FPN 基线模型提升了 1.0%。
Panoptic segmentation aims to perform instance segmentation for foreground instances and semantic segmentation for background stuff simultaneously. The typical top-down pipeline concentrates on two key issues: 1) how to effectively model the intrinsic interaction between semantic segmentation and instance segmentation, and 2) how to properly handle occlusion for panoptic segmentation. Intuitively, the complementarity between semantic segmentation and instance segmentation can be leveraged to improve the performance. Besides, we notice that using detection/mask scores is insufficient for resolving the occlusion problem. Motivated by these observations, we propose a novel deep panoptic segmentation scheme based on a bidirectional learning pipeline. Moreover, we introduce a plug-and-play occlusion handling algorithm to deal with the occlusion between different object instances. The experimental results on COCO panoptic benchmark validate the effectiveness of our proposed method. Codes will be released soon at https://github.com/Mooonside/BANet.
研究动机与目标
- 解决自顶向下全景分割中实例分割与语义分割之间缺乏双向特征交互的问题。
- 通过在特征层面利用两项任务的互补特征来提升性能。
- 比基于分数的方法更准确地解决重叠物体之间的遮挡冲突。
- 设计一个无需额外学习的即插即用遮挡处理模块。
- 验证低层次外观特征在像素到实例分配中的有效性。
提出的方法
- 引入一种双向学习流程,包含两个模块:实例到语义(I2S)和语义到实例(S2I),用于跨任务特征聚合。
- 提出基于双线性插值的 ROIInlay 操作符,将裁剪的实例特征精确映射回完整图像空间,实现准确的特征融合。
- 设计一种无学习的遮挡处理算法,利用低层次特征空间中的外观相似性,将被遮挡的像素分配给最相似的物体实例。
- 在消融研究中使用真实重叠关系来估计遮挡处理性能的上限。
- 采用自顶向下框架,联合优化实例检测与语义分割,并通过双向特征精炼实现改进。
- 将遮挡处理模块作为插件集成到任意自顶向下全景分割网络中,无需重新训练。
实验结果
研究问题
- RQ1实例分割与语义分割之间的双向特征交互是否能提升全景分割性能?
- RQ2使用低层次外观特征是否能比依赖检测分数或掩码分数带来更好的遮挡解决效果?
- RQ3显式建模实例分割与语义分割之间互补性可带来多大性能提升?
- RQ4当使用真实重叠关系时,遮挡处理性能的上限是多少?
- RQ5所提出的遮挡处理模块在不同主干网络上是否均有效?
主要发现
- 所提出的 BANet 在 COCO 全景验证集上达到 59.3% 的 PQ,当同时使用双向聚合模块与遮挡处理模块时,相比 ResNet-101-FPN 基线模型提升了 1.0%。
- 当将遮挡处理模块应用于 ResNet-101-FPN 时,PQ 提升了 1.0%,表明其在不同主干网络上均表现出一致的性能增益。
- 当使用真实重叠关系时,PQ 提升至 53.2%,表明当前遮挡处理方法与理想状态之间仍存在显著性能差距。
- 识别出对物体类别(thing)缺乏识别能力是主要瓶颈,因为分配真实类别标签可使 PQ_Th 提升超过 20%。
- 优先融合物体(things)而非背景(stuff)的融合过程并非最优,因为当使用真实分割结果时,PQ_Sf 仅为 76.4%,表明融合策略仍有改进空间。
- 可视化结果证实,双向架构能纠正大面积误分类区域,且遮挡处理模块能有效解决重叠物体区域的冲突。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。