Skip to main content
QUICK REVIEW

[论文解读] Region Aware Video Object Segmentation with Deep Motion Modeling

Bo Miao, Mohammed Bennamoun|arXiv (Cornell University)|Jul 21, 2022
Visual Attention and Saliency Detection被引用 5
一句话总结

本文提出区域感知视频实例分割(RAVOS),一种快速且准确的半监督VOS方法,通过轻量级物体运动追踪器(OMT)预测感兴趣区域(ROIs),实现高效的对象级分割,并引入运动路径记忆(MPM)模块以减少冗余特征存储。RAVOS在DAVIS上实现86.1 J&F的SOTA性能,推理速度达42 FPS,在YouTube-VOS上实现84.4 J&F,显著优于以往方法,在准确率和推理速度方面均有提升,同时内存使用减少1.9倍。

ABSTRACT

Current semi-supervised video object segmentation (VOS) methods usually leverage the entire features of one frame to predict object masks and update memory. This introduces significant redundant computations. To reduce redundancy, we present a Region Aware Video Object Segmentation (RAVOS) approach that predicts regions of interest (ROIs) for efficient object segmentation and memory storage. RAVOS includes a fast object motion tracker to predict their ROIs in the next frame. For efficient segmentation, object features are extracted according to the ROIs, and an object decoder is designed for object-level segmentation. For efficient memory storage, we propose motion path memory to filter out redundant context by memorizing the features within the motion path of objects between two frames. Besides RAVOS, we also propose a large-scale dataset, dubbed OVOS, to benchmark the performance of VOS models under occlusions. Evaluation on DAVIS and YouTube-VOS benchmarks and our new OVOS dataset show that our method achieves state-of-the-art performance with significantly faster inference time, e.g., 86.1 J&F at 42 FPS on DAVIS and 84.4 J&F at 23 FPS on YouTube-VOS.

研究动机与目标

  • 解决现有基于记忆的视频实例分割(VOS)方法中因对整个图像帧进行分割与存储而产生的高计算冗余问题。
  • 在不牺牲分割准确率的前提下,提升推理速度并减少内存占用,尤其在遮挡等复杂场景下表现更优。
  • 开发一种区域感知的追踪与分割框架,仅聚焦于相关物体区域,最小化背景处理开销。
  • 构建一个全新的大规模基准数据集OVOS,专为评估VOS模型在遮挡条件下的性能而设计。
  • 建立一种新的高效半监督VOS基线,实现速度、准确率与内存效率的平衡。

提出的方法

  • 轻量级物体运动追踪器(OMT)仅使用过去帧的位置特征预测运动参数,避免昂贵的图像特征提取,实现5000 FPS的追踪速度。
  • 通过专用的物体解码器在预测的ROIs内执行对象级分割,利用跳跃连接优化预测结果,减少对背景的误检。
  • 运动路径记忆(MPM)仅存储帧间物体运动路径内的特征,过滤无关背景区域,使内存大小减少1.9倍。
  • 通过将特征匹配限制在运动路径相关区域,MPM使特征匹配速度提升3.8倍,加速时空特征传播。
  • OMT采用线性、二次或三次运动函数建模物体轨迹,其中二次函数表现最佳。
  • 从OVIS构建了一个新的大规模遮挡聚焦数据集OVOS,用于评估VOS模型在真实遮挡场景下的性能。

实验结果

研究问题

  • RQ1区域感知追踪机制是否能在保持高准确率的同时减少视频实例分割中的冗余计算?
  • RQ2与全帧记忆相比,运动路径记忆(MPM)在减少内存存储和加速特征匹配方面效果如何?
  • RQ3轻量级物体运动追踪器(OMT)是否能在不牺牲ROI预测准确率的前提下实现高帧率(如5000 FPS)?
  • RQ4与现有方法相比,所提出的RAVOS方法在遮挡这一VOS主要挑战下的表现如何?
  • RQ5基于预测ROIs的物体级分割在多大程度上提升了推理速度并减少了误检?

主要发现

  • 在DAVIS 2017验证集上,RAVOS实现86.1 J&F,推理速度达42 FPS,准确率与推理速度均优于现有方法。
  • 在YouTube-VOS上,RAVOS实现84.4 J&F,推理速度23 FPS,展现出在多样化与复杂视频条件下的强大性能。
  • 与全帧记忆存储相比,运动路径记忆(MPM)使内存大小减少1.9倍,特征匹配速度提升3.8倍。
  • 物体级分割将特征匹配时间从每帧12.2 ms减少至5.9 ms,解码时间从7.5 ms减少至3.9 ms,显著提升效率。
  • OMT追踪器在单张GPU上实现5000 FPS,每对象仅耗时0.2 ms,比RAFT光流算法快100倍,同时保持了具有竞争力的准确率。
  • 在新引入的OVOS数据集中,RAVOS展现出对遮挡的卓越鲁棒性,验证了其在复杂现实场景中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。