[论文解读] Video Object Segmentation with Joint Re-identification and Attention-Aware Mask Propagation
本文提出 DyeNet,一种用于视频实例分割的统一端到端深度学习框架,联合执行重识别(re-identification)与注意力感知的循环掩码传播。通过迭代扩展模板并利用注意力机制抑制干扰项,DyeNet 在 DAVIS 2017 测试开发集上实现了 68.2 的全局平均(交并比与边界 F-measure)性能,达到当前最先进水平,优于此前所有方法,包括挑战赛优胜方案。
The problem of video object segmentation can become extremely challenging when multiple instances co-exist. While each instance may exhibit large scale and pose variations, the problem is compounded when instances occlude each other causing failures in tracking. In this study, we formulate a deep recurrent network that is capable of segmenting and tracking objects in video simultaneously by their temporal continuity, yet able to re-identify them when they re-appear after a prolonged occlusion. We combine both temporal propagation and re-identification functionalities into a single framework that can be trained end-to-end. In particular, we present a re-identification module with template expansion to retrieve missing objects despite their large appearance changes. In addition, we contribute a new attention-based recurrent mask propagation approach that is robust to distractors not belonging to the target segment. Our approach achieves a new state-of-the-art global mean (Region Jaccard and Boundary F measure) of 68.2 on the challenging DAVIS 2017 benchmark (test-dev set), outperforming the winning solution which achieves a global mean of 66.1 on the same partition.
研究动机与目标
- 解决在严重遮挡和显著外观变化下分割多个视频对象的挑战。
- 克服基于模板的跟踪与时间传播方法在处理长时遮挡和干扰项时的局限性。
- 开发一种统一的、可端到端训练的框架,整合重识别与掩码传播,以提升准确率与鲁棒性。
- 实现有效的模板扩展,以在对象经历遮挡后重新出现时应对大姿态与尺度变化。
- 通过注意力机制提升在循环掩码传播过程中对背景杂波与虚假分割的鲁棒性。
提出的方法
- 提出一种联合框架 DyeNet,将重识别(Re-ID)模块与循环掩码传播(Re-MP)模块结合,支持端到端训练。
- 在 Re-ID 模块中实施迭代模板扩展策略,动态扩展参考模板集合,提升在长时遮挡后对对象的恢复能力。
- 在 Re-MP 模块中引入基于注意力的循环网络,引导掩码传播的同时抑制背景物体或其他片段等干扰项。
- 从 Re-ID 识别出的高置信度起始点出发,采用双向掩码传播以覆盖整个视频序列。
- 在 DAVIS 2017 上进行端到端训练,可选地进行在线微调以进一步提升性能。
- 利用共享主干网络的特征图同时支持 Re-ID 与 Re-MP 模块,确保特征一致性。
实验结果
研究问题
- RQ1一个统一的深度神经网络能否联合优化重识别与循环掩码传播以实现视频对象分割?
- RQ2在大姿态与尺度变化下,迭代模板扩展在多大程度上能提升重识别性能?
- RQ3在循环传播中引入注意力机制,能在多大程度上增强对干扰项与背景杂波的鲁棒性?
- RQ4所提出的框架能否在无需领域特定微调的情况下泛化至多样化数据集?
- RQ5与离线推理相比,采用在线微调的端到端训练能带来多大的性能增益?
主要发现
- DyeNet 在 DAVIS 2017 测试开发集上实现了 68.2 的全新 SOTA 全局平均性能,超过优胜方案的 66.1。
- 通过在线微调,DyeNet 达到 68.2 的全局平均性能,而离线版本为 62.5,表明即使无适应也具备强大性能。
- 在 DAVIS 16 上,DyeNet 经在线微调后达到 86.2 mIoU,优于此前的 SOTA 方法。
- 在 SegTrack v2 与 YouTubeObjects 上,DyeNet 经在线微调后分别达到 78.7 与 79.6 mIoU,展现出优异的跨数据集迁移能力。
- 离线版本的 DyeNet 在单张 Titan Xp GPU 上运行速度达 2.4 FPS,显著快于需每帧 13 秒以上的其他方法。
- DyeNet 在 YouTubeObjects 上的离线预测甚至超过许多真实标注的性能,表明其具有高度可靠性且受标注偏差影响小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。