[论文解读] Boundary-sensitive Network for Portrait Segmentation
本文提出了一种边界感知网络(BSN)用于人像分割,通过三项关键技术改进提升边界精度:个体与全局的边界感知卷积核结合软标签,以及联合边界属性分类器。BSN在多个基准数据集上达到最先进性能,在PFCN数据集上实现96.7%的平均IoU,并在COCO、COCO-Stuff和PASCAL VOC人像分割基准上显著优于先前方法。
Compared to the general semantic segmentation problem, portrait segmentation has higher precision requirement on boundary area. However, this problem has not been well studied in previous works. In this paper, we propose a boundary-sensitive deep neural network (BSN) for portrait segmentation. BSN introduces three novel techniques. First, an individual boundary-sensitive kernel is proposed by dilating the contour line and assigning the boundary pixels with multi-class labels. Second, a global boundary-sensitive kernel is employed as a position sensitive prior to further constrain the overall shape of the segmentation map. Third, we train a boundary-sensitive attribute classifier jointly with the segmentation network to reinforce the network with semantic boundary shape information. We have evaluated BSN on the current largest public portrait segmentation dataset, i.e, the PFCN dataset, as well as the portrait images collected from other three popular image segmentation datasets: COCO, COCO-Stuff, and PASCAL VOC. Our method achieves the superior quantitative and qualitative performance over state-of-the-arts on all the datasets, especially on the boundary area.
研究动机与目标
- 解决人像分割中高精度边界分割的挑战,该问题在通用语义分割方法中常被忽略。
- 提升对发丝、配饰、耳朵等细粒度细节的边界精度,这些细节在背景替换和AR等应用中至关重要。
- 开发一种在无需微调的情况下能良好泛化于多样化人像数据集的方法,包括非受限和具有挑战性的现实图像。
- 在训练过程中整合边界感知监督与形状先验,以增强模型的鲁棒性与定位保真度。
提出的方法
- 通过膨胀前景轮廓并为边界像素分配软标签(作为第三类)引入个体边界感知卷积核,实现在图像级别的边界监督。
- 采用全局边界感知卷积核作为位置敏感先验,编码每个空间位置位于边界的概率,以指导整体分割形状。
- 与分割网络联合训练边界属性分类器,以注入语义形状信息,提升边界表征学习能力。
- 采用软标签策略,将边界像素分配为多类别标签(前景、背景、边界),以更好地捕捉不确定性与边缘连续性。
- 应用空洞卷积以保持高分辨率特征图,保留对边界预测至关重要的空间细节。
- 通过将边界膨胀至10像素,从分割输出生成抠图(trimaps),使其可直接用于图像抠像流水线。
实验结果
研究问题
- RQ1通过软标签实现的显式边界监督是否能提升在具有挑战性的人像边界上的分割精度?
- RQ2将全局边界感知卷积核作为形状先验是否能增强人像分割的整体一致性与准确性?
- RQ3与边界属性分类器联合训练是否能提升网络识别与预测细粒度边界结构的能力?
- RQ4所提方法在无需领域特定微调的情况下,对多样化现实世界人像数据集的泛化能力如何?
- RQ5分割输出在多大程度上可被用于生成高质量抠图以支持图像抠像应用?
主要发现
- BSN在PFCN数据集上实现96.7%的平均IoU,显著优于先前最先进方法。
- 在COCO人像数据集上,BSN达到77.7%的平均IoU,尽管未进行微调,仍大幅超越PortraitFCN+。
- 在COCO-Stuff人像数据集上,BSN实现72.0%的平均IoU,表明其在多样化复杂场景中的强大泛化能力。
- 在PASCAL VOC人像数据集上,BSN实现75.6%的平均IoU,证实其在非受限和低资源人像数据上的鲁棒性。
- 视觉对比显示,与DeepLabv2和PortraitFCN+相比,BSN在发丝、耳朵和配饰等区域生成了更平滑、更精确的边界。
- 图8的定性结果验证了BSN输出生成的抠图适用于下游图像抠像任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。