[论文解读] Video Salient Object Detection via Adaptive Local-Global Refinement
本文提出了一种用于视频显著性目标检测的自适应局部-全局细化网络(LGRN),通过专用的局部和全局细化模块,对多层级空间与时间特征进行优化,实现更优的特征融合。该方法采用基于图卷积网络(GCN)的自适应加权机制,抑制冗余特征并突出具有判别性的相关性,在公开基准上实现了最先进性能,且每帧推理时间仅为0.04秒。
Video salient object detection (VSOD) is an important task in many vision applications. Reliable VSOD requires to simultaneously exploit the information from both the spatial domain and the temporal domain. Most of the existing algorithms merely utilize simple fusion strategies, such as addition and concatenation, to merge the information from different domains. Despite their simplicity, such fusion strategies may introduce feature redundancy, and also fail to fully exploit the relationship between multi-level features extracted from both spatial and temporal domains. In this paper, we suggest an adaptive local-global refinement framework for VSOD. Different from previous approaches, we propose a local refinement architecture and a global one to refine the simply fused features with different scopes, which can fully explore the local dependence and the global dependence of multi-level features. In addition, to emphasize the effective information and suppress the useless one, an adaptive weighting mechanism is designed based on graph convolutional neural network (GCN). We show that our weighting methodology can further exploit the feature correlations, thus driving the network to learn more discriminative feature representation. Extensive experimental results on public video datasets demonstrate the superiority of our method over the existing ones.
研究动机与目标
- 为解决简单融合策略(如加法、拼接)在视频显著性目标检测中导致的特征冗余与跨域相关性利用不足等问题。
- 通过在局部与全局感受野层级上细化融合特征,提升特征表示能力,捕捉多层级特征间的层次化依赖关系。
- 设计一种基于图卷积网络(GCN)的自适应加权机制,动态强调有效特征并抑制无关特征。
- 在保持高效推理速度的前提下,实现视频显著性基准上的优越性能。
- 通过消融研究与最先进方法的对比,验证所提模块的有效性。
提出的方法
- 该方法采用双流编码器-解码器架构,从视频帧中提取空间与时间特征。
- 设计了局部细化模块(LRM),用于在局部感受野内细化特征,捕捉多层级特征间的细粒度空间依赖。
- 引入了全局细化模块(GRM),通过聚合整个特征图上的特征,建模长程全局依赖。
- 采用基于GCN的自适应加权策略,学习不同特征类型之间的动态注意力权重,增强空间与时间特征之间的相关性建模。
- 框架使用联合损失函数(BCE + L1)进行监督训练,以提升边界精度。
- 引入反馈连接,将高层语义信息回传至低层,指导特征细化。
实验结果
研究问题
- RQ1一种分别建模局部与全局依赖的分层细化策略,能否提升视频显著性目标检测中的特征表示?
- RQ2与固定融合策略相比,基于GCN的自适应加权机制在捕捉跨域(空间-时间)特征相关性方面是否更有效?
- RQ3反馈特征的引入是否能增强网络在特征细化与检测精度提升方面的能力?
- RQ4与现有最先进视频显著性模型相比,所提方法在性能与效率方面表现如何?
- RQ5所提各组件(LRM、GRM、GCN加权、反馈)对整体性能的贡献分别是什么?
主要发现
- 在DAVIS数据集上,所提方法取得了$F_{eta}$分数0.954、S度量0.951和MAE 0.013,优于现有最先进方法。
- 消融研究证实,LRM、GRM、基于GCN的加权机制以及反馈特征均对性能提升有显著贡献。
- 基于GCN的自适应加权机制提升了特征相关性建模能力,相比全连接层或无加权策略,生成了更具判别性的表示。
- 所提方法的推理速度为每帧0.04秒,优于先前的视频显著性模型(如MGA的0.07秒和TEN的0.06秒),且与基于图像的SOTA模型相当。
- 主干网络(ResNet50)约占总推理时间的三分之一,尽管结构复杂,但局部与全局细化模块仍具有较高的计算效率。
- 消融研究显示,移除基于GCN的加权机制或反馈特征会导致性能显著下降,证实了其在框架中的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。