[论文解读] Modular Interactive Video Object Segmentation: Interaction-to-Mask, Propagation and Difference-Aware Fusion
MiVOS 提出了一种模块化、解耦的交互式视频实例分割框架,将交互到掩码生成与时间掩码传播分离,并引入一种新型的差异感知融合模块以保留用户意图。该方法在 DAVIS 数据集上以更少的交互次数实现了最先进性能,通过在时空记忆中采用 top-k 过滤策略实现高效推理,并在点击、划线等多种交互类型间具有良好泛化能力。
We present Modular interactive VOS (MiVOS) framework which decouples interaction-to-mask and mask propagation, allowing for higher generalizability and better performance. Trained separately, the interaction module converts user interactions to an object mask, which is then temporally propagated by our propagation module using a novel top-$k$ filtering strategy in reading the space-time memory. To effectively take the user's intent into account, a novel difference-aware module is proposed to learn how to properly fuse the masks before and after each interaction, which are aligned with the target frames by employing the space-time memory. We evaluate our method both qualitatively and quantitatively with different forms of user interactions (e.g., scribbles, clicks) on DAVIS to show that our method outperforms current state-of-the-art algorithms while requiring fewer frame interactions, with the additional advantage in generalizing to different types of user interactions. We contribute a large-scale synthetic VOS dataset with pixel-accurate segmentation of 4.8M frames to accompany our source codes to facilitate future research.
研究动机与目标
- 为解决联合训练在交互式视频对象分割(iVOS)中交互类型与模型性能紧密耦合的局限性。
- 通过解耦交互到掩码生成与掩码传播过程,提升模型泛化能力,支持多样化的用户交互。
- 通过建模每次交互前后掩码的差异,而非依赖原始交互信号,来在传播过程中保留用户意图。
- 通过高效的稀疏交互与鲁棒传播策略,在保持或提升分割准确率的同时降低用户交互成本。
- 通过发布包含 480 万张像素级精确帧的大规模合成 VOS 数据集,推动未来研究发展。
提出的方法
- 将 iVOS 解耦为三个独立模块:交互-掩码模块、传播模块与差异感知融合模块,支持模块化训练与推理。
- 在基于注意力的记忆读取操作中采用轻量级 top-k 过滤策略,提升掩码传播过程中的效率与准确率。
- 引入差异感知融合模块,通过建模交互前后掩码的差异,学习融合前后掩码,从而保留用户意图。
- 采用受 STM 启发的时空记忆网络,用于跨帧存储与检索特征,支持双向掩码传播。
- 利用时空记忆在目标帧对交互前与交互后掩码进行对齐,确保融合与修正传播的准确性。
- 独立训练交互模块以处理多种输入类型(如划线、点击),增强模块化与泛化能力。
实验结果
研究问题
- RQ1解耦的交互式视频对象分割架构是否能在准确率与泛化能力上超越联合训练方法?
- RQ2当交互与传播过程解耦时,如何有效在时间掩码传播中保留用户意图?
- RQ3建模交互前后掩码差异与直接使用原始交互信号相比,对分割性能有何影响?
- RQ4模块化框架在多大程度上可减少所需用户交互次数,同时保持高准确率?
- RQ5与现有方法相比,该方法在不同交互类型(如点击、划线、自由手绘)间的泛化能力如何?
主要发现
- MiVOS 在 DAVIS 2017 交互验证集上达到 88.5 的平均 JIoU,优于 SOTA 方法 ATNet(在相同评估协议下为 84.8)。
- 消融实验表明,差异感知融合模块相比基线在 JIoU@60s 上带来 +1.9 的绝对性能提升,证明其在性能中的关键作用。
- 仅通过三帧交互,MiVOS 即达到 87.9 的最终平均 IoU,显著优于 ATNet 需要更多交互才能达到的相似准确率。
- 用户研究显示,MiVOS(Ours-Free)在最终准确率(87.9)与 AUC(0.87)上均优于 ATNet(AUC 0.75),且用户交互时间更短。
- 该方法在未见过的互联网视频上泛化良好,定性结果表明其在多样化真实世界视频内容中均具备鲁棒的分割能力。
- 所提出的 480 万帧合成数据集可提升预训练效果,并推动未来在交互式 VOS 领域的研究发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。