[论文解读] Video Object Segmentation using Tracked Object Proposals
该论文提出了一种半监督视频实例分割方法,通过结合一次训练的外观网络、语义目标检测与时间跟踪,提升分割精度与鲁棒性。通过利用跟踪得到的边界框对基于外观的分割掩码中的连通域进行过滤,该方法在 DAVIS-2017 上实现了最先进性能,J<sub>mean</sub> 达到 80.1,同时通过简化网络深度与损失结构,将训练时间减少了 10 倍。
We present an approach to semi-supervised video object segmentation, in the context of the DAVIS 2017 challenge. Our approach combines category-based object detection, category-independent object appearance segmentation and temporal object tracking. We are motivated by the fact that the objects semantic category tends not to change throughout the video while its appearance and location can vary considerably. In order to capture the specific object appearance independent of its category, for each video we train a fully convolutional network using augmentations of the given annotated frame. We refine the appearance segmentation mask with the bounding boxes provided either by a semantic object detection network, when applicable, or by a previous frame prediction. By introducing a temporal continuity constraint on the detected boxes, we are able to improve the object segmentation mask of the appearance network and achieve competitive results on the DAVIS datasets.
研究动机与目标
- 为解决一次训练外观网络在视频实例分割中的局限性,如因相似物体导致的误报以及外观变化引起的性能退化。
- 通过引入语义目标检测与时间跟踪作为辅助监督,提升分割的鲁棒性。
- 在不牺牲性能的前提下,显著减少一次训练外观网络的训练时间。
- 在真实用户拍摄的视频上验证该方法,并展示其在实际应用中的可用性。
提出的方法
- 在单个标注帧上端到端训练一个全卷积外观网络,采用数据增强技术,网络结构简化(仅一个辅助输出,单一损失),以加速训练。
- 语义目标检测提供边界框,并在帧间进行时间跟踪,以保证运动一致性。
- 利用边界框跟踪结果对外观网络的分割掩码进行裁剪与优化,通过过滤跟踪区域内的连通域实现。
- 基于与外观掩码的重叠程度,从跟踪边界框内选择连通域,提升定位精度。
- 通过在帧间跟踪目标提议,强制实现时间连续性,减少漂移并提升掩码一致性。
- 该方法在多阶段流水线中融合外观、检测与跟踪信号:外观预测 → 边界框优化 → 通过连通域过滤掩码。
实验结果
研究问题
- RQ1语义目标检测能否提升类别无关视频实例分割的准确性?
- RQ2目标提议的时间跟踪在多帧间如何提升分割的一致性?
- RQ3能否在不降低性能的前提下,显著减少一次训练外观网络的训练时间?
- RQ4该方法在具有复杂多变外观的真实世界用户拍摄视频中泛化能力如何?
主要发现
- 该方法在 DAVIS-2017 验证集上达到 J<sub>mean</sub> 80.1,优于基线方法 OSVOS。
- 在 DAVIS-2016 数据集上,该方法仅用 4,000 次训练迭代即达到 J<sub>mean</sub> 80.1,而 OSVOS 需要 50,000 次迭代。
- 通过将外观网络简化为仅使用一个辅助输出和一个损失层,训练时间减少了 10 倍。
- 在包含 150 段用户拍摄视频的内部数据集上,该方法达到 J<sub>mean</sub> 86.6,表明其在真实世界条件下具有强大的泛化能力。
- 即使首帧标注不完美,系统仍保持鲁棒性,表明其在交互式场景中的实际可用性。
- 消融实验证实,时间跟踪与边界框裁剪对性能有显著贡献,完整流水线在 DAVIS-2016 上实现 80.1 的 J<sub>mean</sub>。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。