[论文解读] Bayesian Semantic Instance Segmentation in Open Set World
本文提出了一种用于开放集环境的贝叶斯语义实例分割方法,仅使用已知类别的边界框标注即可对已知和未知物体进行分割。通过在贝叶斯框架下构建基于边界驱动区域层次结构的模拟退火优化图像划分采样器,该方法在已知类别上实现了具有竞争力的性能,并在未知物体上优于无监督方法。
This paper addresses the semantic instance segmentation task in the open-set conditions, where input images can contain known and unknown object classes. The training process of existing semantic instance segmentation methods requires annotation masks for all object instances, which is expensive to acquire or even infeasible in some realistic scenarios, where the number of categories may increase boundlessly. In this paper, we present a novel open-set semantic instance segmentation approach capable of segmenting all known and unknown object classes in images, based on the output of an object detector trained on known object classes. We formulate the problem using a Bayesian framework, where the posterior distribution is approximated with a simulated annealing optimization equipped with an efficient image partition sampler. We show empirically that our method is competitive with state-of-the-art supervised methods on known classes, but also performs well on unknown classes when compared with unsupervised methods.
研究动机与目标
- 解决开放集中可能出现未知物体类别时的语义实例分割挑战。
- 通过仅使用已知类别的边界框监督进行训练,减少对昂贵实例掩码标注的依赖。
- 开发一种全局分割框架,将感知上一致的区域分组,并分配给已知检测结果或未知物体类别。
- 实现对检测到的和漏检的已知物体、未知物体以及物质类(如天空、草地)的鲁棒分割。
提出的方法
- 将实例分割建模为贝叶斯推断问题,通过模拟退火法近似图像划分的后验分布。
- 利用基于深度神经网络边缘检测生成的边界驱动区域层次结构,高效采样图像划分。
- 集成三种竞争性似然模型:边界模型(用于未知区域)、几何边界框模型(用于已知检测结果)以及可选的掩码模型(用于已知实例)。
- 应用先验模型,惩罚过多区域数量并促进物体紧凑性。
- 采用模拟退火优化方法,探索大规模划分空间并收敛到高质量分割结果。
- 使用分层区域选择机制,在采样过程中自然地执行分裂、合并或分裂-合并操作。
实验结果
研究问题
- RQ1基于仅边界框监督的贝叶斯实例分割框架是否能在已知物体类别上实现具有竞争力的性能?
- RQ2该方法是否能有效分割未知物体类别和物质区域(如草地、天空),而无需对这些类别进行任何监督?
- RQ3与高维划分空间中的标准吉布斯采样相比,所提出的图像划分采样器在效率和质量方面表现如何?
- RQ4边界驱动的区域层次结构在开放集场景中在多大程度上提升了分割精度和鲁棒性?
主要发现
- 尽管仅使用边界框标注进行训练,该方法在已知物体类别上的mIoU得分与完全监督的Mask R-CNN相当。
- 该方法能够以高精度分割未知物体类别和物质区域(如草地、天空),在这些类别上优于现有无监督方法。
- 基于模拟退火的图像划分采样器能够高效探索大规模划分空间,实现高质量分割的速度快于标准吉布斯采样。
- 边界驱动的区域层次结构通过提供结构化且具有感知意义的区域提议,显著提升了分割质量。
- 该方法在未见物体类别上泛化良好,展示了在最先进监督模型失效的开放集条件下具备鲁棒性。
- 通过像素投票对Mask R-CNN预测结果进行后处理,证实了所提方法的全局像素级标注策略比实例级掩码输出更具一致性和准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。