[论文解读] Motion Guided Attention for Video Salient Object Detection
本文提出了一种用于视频显著性目标检测的运动引导注意力网络,通过双分支架构显式建模运动线索:一个分支在静态帧中检测显著目标,另一个分支在光流图中检测运动显著性。该方法使用新颖的运动引导注意力模块,将运动显著性增强外观特征,在 DAVIS 和 FBMS 基准上实现了最先进性能,DAVIS 上的 MAE 为 0.022,maxF 为 0.902;FBMS 上的 MAE 为 0.027,maxF 为 0.910。
Video salient object detection aims at discovering the most visually distinctive objects in a video. How to effectively take object motion into consideration during video salient object detection is a critical issue. Existing state-of-the-art methods either do not explicitly model and harvest motion cues or ignore spatial contexts within optical flow images. In this paper, we develop a multi-task motion guided video salient object detection network, which learns to accomplish two sub-tasks using two sub-networks, one sub-network for salient object detection in still images and the other for motion saliency detection in optical flow images. We further introduce a series of novel motion guided attention modules, which utilize the motion saliency sub-network to attend and enhance the sub-network for still images. These two sub-networks learn to adapt to each other by end-to-end training. Experimental results demonstrate that the proposed method significantly outperforms existing state-of-the-art algorithms on a wide range of benchmarks. We hope our simple and effective approach will serve as a solid baseline and help ease future research in video salient object detection. Code and models will be made available.
研究动机与目标
- 为解决现有方法中常被忽视的关键挑战:有效将目标运动整合到视频显著性目标检测中。
- 通过显式建模光流图中的运动显著性,提升显著性检测性能,利用运动作为视觉注意力的关键线索。
- 设计一种多任务学习框架,在端到端训练前分别对外观分支和运动分支进行预训练,以增强特征学习。
- 设计新颖的运动引导注意力模块,通过运动显著性动态关注外观特征,提升特征表示能力。
- 建立一种强大且简洁的基线模型,无需复杂循环结构即可超越基于长程记忆的模型。
提出的方法
- 该方法采用双分支网络:一个分支处理 RGB 帧以进行静态图像显著性目标检测,另一个分支处理光流图以进行运动显著性检测。
- 引入运动引导注意力模块,利用运动分支的显著性图,通过空间和通道注意力机制,对外观分支进行关注与增强。
- 注意力模块结合残差学习,设计轻量化,实现高效特征融合,无需长程时间记忆。
- 采用多任务训练方案进行端到端训练:外观分支在静态图像 SOD 上预训练,运动分支在运动显著性检测上预训练,随后进行联合优化。
- 仅使用前一帧的短程上下文,避免使用如 ConvLSTM 等复杂循环单元。
- 评估了拼接、逐元素相乘和加法等融合策略,其中 MGA-tmc(编码器)和 MGA-m(解码器)模块表现最佳。
实验结果
研究问题
- RQ1在光流图中显式建模运动显著性是否能超越仅依赖外观的方法,提升视频显著性目标检测性能?
- RQ2如何通过注意力机制有效整合运动线索到基于外观的显著性检测中?
- RQ3在端到端训练前分别对运动分支和外观分支进行预训练,是否能优于从零开始的联合训练?
- RQ4在运动引导特征增强中,哪种注意力模块设计(空间、通道或联合)性能最高?
- RQ5仅使用短程时间上下文的轻量化、非循环架构,能否在视频 SOD 中超越现有基于长程记忆的模型?
主要发现
- 所提方法在 DAVIS 2017 基准上达到最先进性能,MAE 为 0.022,S-m 为 0.913,maxF 为 0.902,优于先前最先进方法。
- 在 FBMS 基准上,方法实现 MAE 0.027,S-m 0.907,maxF 0.910,展现出在多样化视频数据集上的强大泛化能力。
- 多任务训练方案(Tma)优于单任务预训练和从零开始的端到端训练,在 DAVIS 上提升 maxF 1.7%,在 FBMS 上提升 1.9%。
- 编码器中的 MGA-tmc 模块和解码器中的 MGA-m 模块表现最佳,在 FBMS 上相比逐元素相加提升 0.8% maxF,在 DAVIS 上提升 0.9% S-m。
- 消融实验证实,运动引导注意力模块显著优于简单的融合策略(如拼接和加法)。
- 在具有多个显著目标的视频中,即使运动线索不具区分性,该方法也能通过有效平衡外观与运动特征,表现出鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。