[论文解读] DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence from Box Supervision
DiscoBox 提出了一种自集成框架,通过仅使用边界框标注,联合学习弱监督实例分割与语义对应关系。通过利用具有单变量、成对及跨图像势能的结构化教师模型,该方法为两个任务生成伪标签,实现了最先进性能:在 COCO 上达到 37.9% AP,在 PASCAL VOC12 和 PF-PASCAL 上也取得了最先进结果。
We introduce DiscoBox, a novel framework that jointly learns instance segmentation and semantic correspondence using bounding box supervision. Specifically, we propose a self-ensembling framework where instance segmentation and semantic correspondence are jointly guided by a structured teacher in addition to the bounding box supervision. The teacher is a structured energy model incorporating a pairwise potential and a cross-image potential to model the pairwise pixel relationships both within and across the boxes. Minimizing the teacher energy simultaneously yields refined object masks and dense correspondences between intra-class objects, which are taken as pseudo-labels to supervise the task network and provide positive/negative correspondence pairs for dense constrastive learning. We show a symbiotic relationship where the two tasks mutually benefit from each other. Our best model achieves 37.9% AP on COCO instance segmentation, surpassing prior weakly supervised methods and is competitive to supervised methods. We also obtain state of the art weakly supervised results on PASCAL VOC12 and PF-PASCAL with real-time inference.
研究动机与目标
- 解决缺乏同时包含实例分割掩码与密集语义对应关系的大规模数据集的问题。
- 通过实现相互监督,克服解耦方法在实例分割与语义对应关系任务中的局限性。
- 开发一种仅使用边界框标注的弱监督框架,用于训练实例分割与语义对应关系模型。
- 建立一种共生学习关系,其中定位性能的提升可增强对应关系质量,反之亦然。
- 在 PASCAL 3D+ 上引入一个新型多对象语义对应基准,并采用合理评估指标。
提出的方法
- 设计一种自集成框架,其中任务网络从边界框监督中预测初始掩码与对应关系。
- 构建一个结构化教师模型,作为具有单变量、成对及跨图像势能的吉布斯能量函数,以优化预测结果。
- 利用教师模型的能量最小化过程,为实例分割与密集对应关系任务生成高质量伪标签。
- 通过从教师模型输出中提取的正负对应关系对,引入密集对比学习,以提升表征学习效果。
- 利用类内对应关系与物体定位作为相互监督信号,减少边界框监督下的歧义性。
- 端到端训练任务网络,使用教师模型生成的伪标签,实现大规模弱监督数据的可扩展训练。
实验结果
研究问题
- RQ1是否能够仅从边界框监督中联合学习实例分割与语义对应关系?
- RQ2具有类内与跨图像势能的结构化教师模型,如何提升两个任务的伪标签质量?
- RQ3在弱监督设置下,密集对比学习对提升对应关系与分割表征有何影响?
- RQ4定位与对应关系之间的相互监督能否减少边界框监督学习中的平凡解?
- RQ5所提出的框架在多对象场景下是否具备良好的泛化能力,并优于现有弱监督方法在语义对应基准上的表现?
主要发现
- 在 COCO 实例分割任务上,DiscoBox 达到 37.9% AP,优于监督方法如 YOLACT++(34.6% AP)和 Mask R-CNN(37.1% AP)。
- 在 PASCAL VOC12 上,DiscoBox 达到 59.3% PCK@0.05,优于先前最先进方法如 DCC-Net(55.6%)和 NC-Net(54.3%)。
- 在 PF-PASCAL 基准上,DiscoBox 达到 95.3% PCK@0.15,显著优于弱监督语义对应方法 SF-Net(90.6%)和 DHPF(91.1%)。
- 在 PASCAL 3D+ 上,DiscoBox 达到 31.7% AP,优于 SCOT(29.3%)和消融实验的 DiscoBox-(30.9%),证明了完整框架的有效性。
- 消融实验表明,密集对比学习与结构化教师模型对性能至关重要,仅使用教师模型即可使结果相比基线提升 1.8% AP。
- 该框架在不同数据集(包括 COCO、VOC12、PF-PASCAL 和 PASCAL 3D+)上均表现出良好泛化能力,且无需在目标基准上进行微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。