[论文解读] Multi-Source Fusion and Automatic Predictor Selection for Zero-Shot Video Object Segmentation
本文提出了一种用于零样本视频实例分割的多源融合与自动预测器选择框架,通过引入RGB、深度、光流和静态显著性特征,结合内感受空间注意力模块(ISAM)与特征净化模块(FPM)以增强特征融合。一个自动预测器选择(APS)网络动态选择静态显著性预测或运动目标预测,以减轻低质量光流带来的误差,在DAVIS 16、Youtube-Objects和FBMS基准上实现了最先进性能。
Location and appearance are the key cues for video object segmentation. Many sources such as RGB, depth, optical flow and static saliency can provide useful information about the objects. However, existing approaches only utilize the RGB or RGB and optical flow. In this paper, we propose a novel multi-source fusion network for zero-shot video object segmentation. With the help of interoceptive spatial attention module (ISAM), spatial importance of each source is highlighted. Furthermore, we design a feature purification module (FPM) to filter the inter-source incompatible features. By the ISAM and FPM, the multi-source features are effectively fused. In addition, we put forward an automatic predictor selection network (APS) to select the better prediction of either the static saliency predictor or the moving object predictor in order to prevent over-reliance on the failed results caused by low-quality optical flow maps. Extensive experiments on three challenging public benchmarks (i.e. DAVIS$_{16}$, Youtube-Objects and FBMS) show that the proposed model achieves compelling performance against the state-of-the-arts. The source code will be publicly available at extcolor{red}{\url{https://github.com/Xiaoqi-Zhao-DLUT/Multi-Source-APS-ZVOS}}.
研究动机与目标
- 为解决现有零样本视频实例分割(ZVOS)方法仅依赖RGB或RGB与光流的局限性,通过引入多种互补信息源。
- 通过内感受空间注意力模块(ISAM)自适应地突出每种源特征的空间重要性,以改善特征融合。
- 通过特征净化模块(FPM)过滤不兼容特征,减少源间干扰。
- 通过预测器选择网络(APS)自动在静态显著性预测与运动目标预测之间选择,减轻低质量光流导致的性能下降。
- 通过整合多源特征与智能预测器选择,实现在标准ZVOS基准上的最先进性能。
提出的方法
- 采用共享编码器与两个解码器的多任务网络,基于RGB输入预测深度图与静态显著性图,使用FPN架构。
- 内感受空间注意力模块(ISAM)基于空间上下文自适应计算每种源特征图的注意力权重,突出更具信息量的特征。
- 特征净化模块(FPM)将融合后的特征图分解为共性与独占成分,减去独占部分以抑制背景噪声并保留运动目标线索。
- 自动预测器选择(APS)网络评估基于光流的预测可靠性,并根据置信度分数在静态显著性预测器与运动目标预测器之间进行选择。
- 最终预测由所选预测器生成,确保对低质量光流的鲁棒性。
- 该框架在DAVIS 16、Youtube-Objects与FBMS上端到端训练,损失函数包括深度、显著性与分割监督。
实验结果
研究问题
- RQ1如何有效融合多种视觉源(RGB、深度、光流、静态显著性)以提升零样本视频实例分割性能?
- RQ2一种考虑源间空间关系的注意力机制是否能增强多源融合中的特征表示?
- RQ3如何过滤源间不兼容或噪声特征以提升分割精度?
- RQ4自动预测器选择机制是否能降低对潜在不可靠光流的依赖并提升鲁棒性?
- RQ5多源特征融合与智能预测器选择的集成是否能在标准ZVOS基准上实现最先进性能?
主要发现
- 在DAVIS 16基准上,所提方法实现了83.4的mIoU与82.3的平均F-measure,优于先前最先进方法。
- 在Youtube-Objects数据集上,方法实现了74.9的mIoU与83.3的平均F-measure,展现出在低质量光流条件下的强泛化能力。
- 与简单拼接多源特征相比,ISAM模块使mIoU提升2.1%,平均F-measure提升1.6%。
- FPM进一步将mIoU提升1.1%,平均F-measure提升1.1%,证实其在过滤不兼容特征方面的有效性。
- APS网络通过根据光流质量选择更优预测器(SOS或MOS),在Youtube-Objects上表现优于独立的SOS(72.7 mIoU)与MOS(70.2 mIoU)。
- 可视化结果表明,APS在低质量光流视频中分配低分,而在高质量光流视频中分配高分,验证了其自适应选择机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。