[论文解读] Open-World Instance Segmentation: Exploiting Pseudo Ground Truth From Learned Pairwise Affinity
本文提出通用分组网络(GGNs)用于开放世界实例分割,利用学习到的成对亲和力预测器从无标签图像中生成伪真实掩码。通过将这些伪掩码与真实标注相结合,GGNs在COCO、LVIS、ADE20K和UVO基准上均达到最先进性能,显著优于封闭世界模型在未见类别上的表现,并展现出对域外数据的强大泛化能力。
Open-world instance segmentation is the task of grouping pixels into object instances without any pre-determined taxonomy. This is challenging, as state-of-the-art methods rely on explicit class semantics obtained from large labeled datasets, and out-of-domain evaluation performance drops significantly. Here we propose a novel approach for mask proposals, Generic Grouping Networks (GGNs), constructed without semantic supervision. Our approach combines a local measure of pixel affinity with instance-level mask supervision, producing a training regimen designed to make the model as generic as the data diversity allows. We introduce a method for predicting Pairwise Affinities (PA), a learned local relationship between pairs of pixels. PA generalizes very well to unseen categories. From PA we construct a large set of pseudo-ground-truth instance masks; combined with human-annotated instance masks we train GGNs and significantly outperform the SOTA on open-world instance segmentation on various benchmarks including COCO, LVIS, ADE20K, and UVO. Code is available on project website: https://sites.google.com/view/generic-grouping/.
研究动机与目标
- 为解决开放世界设置下未见类别实例分割的性能差距,现有模型因依赖预定义的类别分类体系而失效。
- 开发一种与类别无关的实例提议方法,可在无需语义监督的情况下泛化至多样且未见的对象类别。
- 通过利用大规模无标签数据上无监督的成对亲和力学习生成的伪真实掩码,提升模型泛化能力。
- 证明在无标签图像上基于伪真实掩码进行预训练,相比ImageNet监督,能为开放世界泛化提供更强的归纳偏置。
提出的方法
- 训练一个成对亲和力预测器(PA),利用非穷尽的分割掩码作为监督信号,预测局部像素级关系,从而实现对未见类别的泛化能力。
- PA模型生成的亲和力图作为输入送入分组模块,生成高质量、与类别无关的掩码提议,作为伪真实掩码。
- 使用真实人工标注掩码与生成的伪真实掩码联合微调一种与类别无关的Mask R-CNN,以提升通用实例提议能力。
- 通过在大规模无标签数据集(如ImageNet、OpenImages)上预训练来扩展方法规模,其中基于PA的分组可生成额外数据多样性的伪掩码。
- 通过结合多个目标度量分数提升性能:一个来自基于PA的分组,另一个来自OLN(开放世界学习网络)模块。
- 评估时在ADE20K和UVO上不进行微调,将所有掩码视为真实标签,以模拟真实开放世界场景。
实验结果
研究问题
- RQ1一个在无语义监督下训练的模型,能否通过利用无监督的局部像素关系,在开放世界实例分割上实现强大性能?
- RQ2与标准监督预训练相比,从成对亲和力生成的伪真实掩码是否能提升对未见类别的泛化能力?
- RQ3在无标签图像的伪真实掩码上进行预训练,对开放世界与封闭世界设置下的性能有何影响?
- RQ4结合基于PA的分组与现有开放世界模型(如OLN)是否能进一步提升最先进性能?
主要发现
- 在ADE20K和UVO上,GGNs显著优于Mask R-CNN和Selective Search,实现20个真实目标中14个真阳性提议,分别优于后者的5个和4个。
- 在LVIS基准上,使用伪真实掩码预训练的GGN将平均召回率(AR@100)提升6.8%,超过之前最先进方法(OLN),确立新最先进水平。
- 在ImageNet上基于伪真实掩码进行预训练,开放世界性能相比ImageNet监督预训练提升1.4%,尽管在封闭世界设置下表现略低。
- 每张图像生成更多伪真实掩码以及在预训练中使用更多无标签像素,可提升性能,表明方法具备可扩展性并能有效抵抗噪声。
- 该方法在真实世界场景中泛化良好:在ADE20K和UVO上不进行微调评估时,GGN在可见与未见类别上均取得高于基线的AR和AP。
- 结合基于PA的分组与OLN模块的目标度量分数可进一步提升性能,表明两者在提议排序方面具有互补优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。