[论文解读] 1st Place Solution for the UVO Challenge on Image-based Open-World Segmentation 2021
该论文提出了一种两阶段实例分割框架,首先使用具有级联RPN、SimOTA标签分配和Swin-L主干网络等先进组件的类别无关、基于锚框的检测器检测目标,然后对裁剪的边界框应用类别无关的分割网络。该方法在2021年UVO挑战赛中获得第一名,在COCO上AR@1000达到77.4,在UVO-Sparse测试集上达到61.77。
We describe our two-stage instance segmentation framework we use to compete in the challenge. The first stage of our framework consists of an object detector, which generates object proposals in the format of bounding boxes. Then, the images and the detected bounding boxes are fed to the second stage, where a segmentation network is applied to segment the objects in the bounding boxes. We train all our networks in a class-agnostic way. Our approach achieves the first place in the UVO 2021 Image-based Open-World Segmentation Challenge.
研究动机与目标
- 为解决开放世界实例分割的挑战,即模型必须在真实世界图像中检测并分割此前未见过的物体类别。
- 在运动模糊、遮挡和极端姿态等复杂场景中,提升检测召回率和定位精度。
- 通过结合在多样化数据集上训练的强大检测与分割组件,在UVO 2021基准上实现最先进性能。
- 展示解耦头、自适应卷积和先进标签分配在开放世界设置下的目标检测中的有效性。
提出的方法
- 该方法采用两阶段流程:首先,基于锚框的目标检测器使用Swin-L变换器主干网络结合FPN和CARAFE进行特征上采样,生成边界框提议。
- 检测网络采用具有可变形卷积(DCNv2)的级联RPN,使用解耦的分类与回归头,并引入IoU分支以优化提议质量。
- 对分类头和回归头分别应用SimOTA标签分配,采用不同的top-K设置以提升正样本选择效果。
- 分割阶段采用基于UperNet的架构,主干网络为Swin-L,处理从原始图像中根据预测边界框裁剪出的图像块。
- 所有模型均以类别无关的方式进行训练,减少对已见类别的偏见,提升对开放世界物体的泛化能力。
- 推理时采用翻转测试增强,模型在ImageNet-22k上预训练,并在COCO、OpenImages、PASCAL VOC和UVO数据集上微调。
实验结果
研究问题
- RQ1在遮挡、模糊和罕见物体形状水平较高的开放世界设置下,如何提升目标检测性能?
- RQ2诸如级联RPN、SimOTA和解耦头等先进检测组件在开放世界实例分割中对召回率和定位精度的提升程度如何?
- RQ3当在多样化数据集上训练时,两阶段检测-分割流程是否能优于端到端方法?
- RQ4类别无关训练在实现对真实世界基准(如UVO)中未见物体类别的泛化能力方面有多有效?
主要发现
- 最终检测器在COCO val2017上达到AR@1000为77.4,相较于基线(58.3)在所有组件添加后显著提升。
- 采用Swin-L变换器主干网络使AR@1000从ResNet-50的73.9提升至77.4,证明其在开放世界检测中的有效性。
- 完整方法在UVO-Sparse测试集上达到61.77的AR@100,远超第二名团队的58.06。
- 消融实验表明,加入SimOTA和IoU分支使AR@1000提升2.5分,而解耦头和CARAFE分别贡献1.5分和0.3分。
- 分割网络在COCO、OpenImages和PASCAL VOC上训练后,即使在运动模糊和强烈遮挡下也能生成高质量掩码,如定性结果所示。
- 在UVO-Sparse和UVO-Dense数据集上微调6个周期后检测性能提升,表明领域特定适应具有重要价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。