[论文解读] UVOSAM: A Mask-free Paradigm for Unsupervised Video Object Segmentation via Segment Anything Model
UVOSAM 提出了一种无需掩码的无监督视频实例分割框架,通过利用视频显著目标追踪(VSOT)网络生成的轨迹作为提示,来调用分割一切模型(SAM)。该方法在 DAVIS2017 数据集上实现了最先进性能,显著优于依赖掩码监督的方法,且无需任何人工掩码标注。
The current state-of-the-art methods for unsupervised video object segmentation (UVOS) require extensive training on video datasets with mask annotations, limiting their effectiveness in handling challenging scenarios. However, the Segment Anything Model (SAM) introduces a new prompt-driven paradigm for image segmentation, offering new possibilities. In this study, we investigate SAM's potential for UVOS through different prompt strategies. We then propose UVOSAM, a mask-free paradigm for UVOS that utilizes the STD-Net tracker. STD-Net incorporates a spatial-temporal decoupled deformable attention mechanism to establish an effective correlation between intra- and inter-frame features, remarkably enhancing the quality of box prompts in complex video scenes. Extensive experiments on the DAVIS2017-unsupervised and YoutubeVIS19\&21 datasets demonstrate the superior performance of UVOSAM without mask supervision compared to existing mask-supervised methods, as well as its ability to generalize to weakly-annotated video datasets. Code can be found at https://github.com/alibaba/UVOSAM.
研究动机与目标
- 解决人工标注视频掩码数据集在无监督视频实例分割(VOS)中成本高且难以扩展的问题。
- 通过克服 SAM 在实例发现和身份关联能力上的不足,实现 SAM 在无监督 VOS 中的应用。
- 开发一个完全自动化的流程,生成稳定的目标轨迹以提示 SAM,从而消除对人工标注掩码的需求。
- 通过专用的视频显著目标追踪网络利用时空相关性,提升复杂场景下的分割精度。
提出的方法
- 提出两阶段框架:首先,视频显著目标追踪(VSOT)模型检测显著目标,并在帧间生成完整的对象轨迹。
- 使用预测的轨迹(作为边界框)作为提示,向 SAM 输入以逐帧生成掩码,替代人工掩码标注。
- 基于 IDOL 架构设计 VSOT 网络,但移除掩码预测分支,以专注于判别性特征学习和时序一致性。
- 采用边界框和点提示,消融实验表明,结合边界框与多个点(例如 3–5 个)可获得最佳性能。
- 利用 VSOT 中的空间与时间对应关系,确保视频序列中对象关联的稳定与准确。
- 应用提示组合策略(例如边界框 + 3–5 个点),以减少歧义并提升复杂场景下的掩码精度。

实验结果
研究问题
- RQ1能否在无需人工掩码标注的情况下,有效将分割一切模型(SAM)适配于无监督视频实例分割?
- RQ2在视频设置中,如何克服 SAM 缺乏实例发现与身份关联能力的问题?
- RQ3在视频上下文中提示 SAM 时,何种提示配置(如边界框、点或组合)能获得最佳分割性能?
- RQ4视频显著目标追踪网络能否生成可靠、长期的轨迹,作为复杂场景中 SAM 的有效提示?
- RQ5基于 SAM 与轨迹提示的无掩码范式是否优于现有的掩码监督型无监督 VOS 方法?
主要发现
- UVOSAM 在 DAVIS2017 验证集上取得 88.3 的 J&F 分数,显著优于当前基于掩码监督的最先进方法。
- 边界框与 5 个点提示的组合取得最高性能(J&F = 88.3),表明结构化与密集的空间线索可增强 SAM 的分割精度。
- 在点提示中使用 3 个点相比单一点提示,使 J&F 分数提升 29.6 分,表明更多点可减少语义歧义。
- VSOT 模型本身取得 78.9 的 J&F 分数,表明其在显著目标发现与轨迹生成方面表现强劲。
- UVOSAM 在 DAVIS2017 上所有指标上均优于所有基线方法,包括 MOT(61.1 J&F)与 VSOT(78.9 J&F),证明其优越性。
- 尽管在检测细长物体或处理遮挡方面存在局限,UVOSAM 通过有效利用时空相关性,在复杂场景中仍表现出稳健性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。