Skip to main content
QUICK REVIEW

[论文解读] Robust High-Resolution Video Matting with Temporal Guidance

Shanchuan Lin, Linjie Yang|arXiv (Cornell University)|Aug 25, 2021
Image Enhancement Techniques被引用 13
一句话总结

本文提出一种轻量级、实时的视频抠像方法,采用循环神经网络架构并引入时序引导,以提升高分辨率人像视频抠像的时序一致性和鲁棒性。通过联合训练抠像和语义分割目标,模型实现了最先进性能——在4K视频上达到76 FPS,在HD视频上达到104 FPS,且无需使用抠像图(trimaps)或预先捕获的背景。

ABSTRACT

We introduce a robust, real-time, high-resolution human video matting method that achieves new state-of-the-art performance. Our method is much lighter than previous approaches and can process 4K at 76 FPS and HD at 104 FPS on an Nvidia GTX 1080Ti GPU. Unlike most existing methods that perform video matting frame-by-frame as independent images, our method uses a recurrent architecture to exploit temporal information in videos and achieves significant improvements in temporal coherence and matting quality. Furthermore, we propose a novel training strategy that enforces our network on both matting and segmentation objectives. This significantly improves our model's robustness. Our method does not require any auxiliary inputs such as a trimap or a pre-captured background image, so it can be widely applied to existing human matting applications.

研究动机与目标

  • 开发一种实时、高分辨率的视频抠像方法,提升时序一致性与鲁棒性,且不依赖抠像图或背景图像等辅助输入。
  • 解决逐帧抠像方法忽略时序一致性的局限,缓解闪烁和伪影问题。
  • 通过联合训练抠像与语义分割目标,提升模型泛化能力,减少对合成数据分布的过拟合。
  • 通过确保快速推理与高质量结果,实现视频会议和内容创作等实际应用场景的可部署性。

提出的方法

  • 采用循环神经网络架构,利用隐藏状态建模视频帧之间的时序依赖关系,提升时序一致性。
  • 提出一种新型训练策略,联合优化alpha抠像预测与语义分割任务,增强对真实世界视频变化的鲁棒性。
  • 使用深度引导滤波器(DGF)结合循环解码器特征,精细化高分辨率alpha抠像预测,保留细节。
  • 采用轻量级MobileNetV3主干网络并结合空洞空间金字塔池化(LR-ASPP),实现高效特征提取与高分辨率输出。
  • 设计训练流程,结合合成抠像数据与真实图像语义分割监督,减少域偏移问题。
  • 消除对外部输入(如抠像图或预捕获背景)的依赖,实现即插即用的部署。
Figure 1 : Our network consists of a feature-extraction encoder, a recurrent decoder, and Deep Guided Filter (DGF) module. To process high-resolution videos, the input is first downsampled for the encoder-decoder network, then DGF is used to upsample the result.
Figure 1 : Our network consists of a feature-extraction encoder, a recurrent decoder, and Deep Guided Filter (DGF) module. To process high-resolution videos, the input is first downsampled for the encoder-decoder network, then DGF is used to upsample the result.

实验结果

研究问题

  • RQ1与独立帧处理方法相比,循环架构是否能显著提升高分辨率视频抠像的时序一致性?
  • RQ2在抠像与语义分割目标上联合训练是否能增强对真实世界视频变化的鲁棒性,并减少对合成数据的过拟合?
  • RQ3在背景动态变化或场景复杂时,该方法在背景重建困难的场景下表现如何?
  • RQ4与标准引导滤波相比,深度引导滤波器(DGF)在细节准确性和时序一致性方面提升程度如何?
  • RQ5轻量级模型是否能在保持4K与HD视频实时推理的前提下实现最先进性能?

主要发现

  • 在NVIDIA GTX 1080Ti上,模型在4K视频上达到76 FPS,在HD视频上达到104 FPS,速度与模型效率均优于先前方法。
  • 在COCO验证集上,人体分割mIOU达到61.50,表明在真实图像上具有强鲁棒性。
  • 联合训练分割目标可提升泛化能力:当对alpha值>0.5进行阈值处理时,mIOU达60.88,而未使用分割监督训练的模型仅达38.24。
  • 深度引导滤波器(DGF)相比FGF,Grad指标提升1.38分,dtSSD降低0.25,表明细节准确性与时序一致性更优。
  • 在动态背景场景中,模型优于BGMv2(在背景错位时失效)与MODNet,MAD更低(7.50 vs. 11.23),MSE更小(2.80 vs. 5.65)。
  • 采用ResNet50主干与扩展解码器通道数的更大模型,在102.9 MB参数量下实现71.1 FPS,指标更优(MAD: 5.81, Grad: 9.65),适用于服务端扩展。
(a) Alpha Detail
(a) Alpha Detail

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。