[论文解读] Weakly Supervised Object Localization Using Things and Stuff Transfer
本文提出了一种弱监督目标定位方法——事物与物质迁移(TST),该方法将语义分割知识(包括事物/物质图、类别相似性及共现关系)从源数据集(PASCAL Context)迁移到目标数据集(ILSVRC、COCO、VOC 2007),且无需边界框标注。通过利用迁移知识对分割图进行优化,并将其作为提示注入多实例学习框架,TST实现了最先进性能,相较于标准MIL方法mAP最高提升7.9%,并优于以往的迁移方法。
We propose to help weakly supervised object localization for classes where location annotations are not available, by transferring things and stuff knowledge from a source set with available annotations. The source and target classes might share similar appearance (e.g. bear fur is similar to cat fur) or appear against similar background (e.g. horse and sheep appear against grass). To exploit this, we acquire three types of knowledge from the source set: a segmentation model trained on both thing and stuff classes; similarity relations between target and source classes; and co-occurrence relations between thing and stuff classes in the source. The segmentation model is used to generate thing and stuff segmentation maps on a target image, while the class similarity and co-occurrence knowledge help refining them. We then incorporate these maps as new cues into a multiple instance learning framework (MIL), propagating the transferred knowledge from the pixel level to the object proposal level. In extensive experiments, we conduct our transfer from the PASCAL Context dataset (source) to the ILSVRC, COCO and PASCAL VOC 2007 datasets (targets). We evaluate our transfer across widely different thing classes, including some that are not similar in appearance, but appear against similar background. The results demonstrate significant improvement over standard MIL, and we outperform the state-of-the-art in the transfer setting.
研究动机与目标
- 通过利用具有完整标注的源数据集中的知识,提升缺乏边界框标注类别在弱监督目标定位(WSOL)中的性能。
- 探索同时迁移‘物质’(如草地或天空等背景材质)与‘事物’(如汽车或动物等物体)的潜在价值,以提升定位性能。
- 开发一个统一框架,将迁移的语义分割、类别相似性及共现关系作为新提示,整合进多实例学习(MIL)流程。
- 在多样且不相似的目标类别上验证该迁移方法的有效性,包括外观不同但共享背景情境的类别。
提出的方法
- 在源数据集(PASCAL Context)上训练一个全监督语义分割模型,为目标图像生成事物与物质的分割图(得分图与标签图)。
- 将源数据集中事物与物质类别之间的类别相似性及共现关系迁移到目标数据集,作为优化分割图的加权函数。
- 提出三种评分策略——标签加权、对比加权与面积加权,以实现从像素级图到目标提议级别的知识传播。
- 将优化后的得分整合进多实例学习(MIL)框架,使用TST得分作为新提示以提升提议排序性能。
- 使用代理度量(Rank与CorLoc@1)在源数据集验证集上联合优化评分参数,确保对目标数据集的泛化能力。
- 进行消融研究,验证每个组件(LW、CW、AW)及其组合在最终评分流程中的贡献。
实验结果
研究问题
- RQ1能否通过从同时包含事物与物质标注的源数据集迁移语义分割知识,提升在无边界框标注的目标数据集上的弱监督目标定位性能?
- RQ2在目标与源类别外观不同但共享背景情境时,事物与物质类别间共现关系的迁移在多大程度上能提升定位性能?
- RQ3标签加权、对比加权与面积加权策略在MIL框架中,单独及联合使用时,对提议评分的提升程度如何?
- RQ4在传统的事物到事物迁移方法之外,整合迁移的‘物质’知识(如草地、天空)是否能带来性能增益?
- RQ5所提出的TST方法在ILSVRC、COCO和VOC 2007等标准基准上,与最先进WSOL及迁移学习方法相比表现如何?
主要发现
- TST显著优于标准Deep MIL基线,在ILSVRC-20上使用基于外观的相似性(APP)时,CorLoc绝对提升7.9%,达到47.6%的CorLoc,且三种评分策略全部使用时表现最佳。
- 在PASCAL VOC 2007上,TST优于最先进WSOL方法[27]与事物到事物迁移方法[21],实现60.8%的mAP与47.6%的CorLoc。
- 在ILSVRC-20上,TST的mAP比LSDA[20]迁移方法高出1.5%,证明其在跨数据集迁移学习中的优越性。
- 消融研究证实,三种评分策略(LW、CW、AW)均具有独立贡献,三者联合使用时性能最高,ILSVRC-20上CorLoc达到47.6%。
- 代理度量(Rank与CorLoc@1)验证了所提评分函数能有效将目标物体提议优先于背景提议,基于APP的相似性优于基于SEM的相似性。
- 将TST与Objectness及多折叠(multifolding)结合,性能进一步提升5%,证实了所提提示与现有最先进组件具有良好的互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。