Skip to main content
QUICK REVIEW

[论文解读] MODNet-V: Improving Portrait Video Matting via Background Restoration

Jiayu Sun, Zhanghan Ke|arXiv (Cornell University)|Sep 24, 2021
Image Enhancement Techniques参考文献 46被引用 5
一句话总结

本文提出MODNet-V,一种轻量级视频抠像模型,通过一种新颖的背景恢复模块(BRM)动态地从先前视频帧中恢复背景,从而提升人像抠像效果。该模型利用自监督的背景先验,而非用户提供的抠像图或背景图像,仅需MODNet模型1/3的参数量,即可实现单张GPU上的端到端训练,并通过补丁精炼模块(PRM)支持高分辨率推理。

ABSTRACT

To address the challenging portrait video matting problem more precisely, existing works typically apply some matting priors that require additional user efforts to obtain, such as annotated trimaps or background images. In this work, we observe that instead of asking the user to explicitly provide a background image, we may recover it from the input video itself. To this end, we first propose a novel background restoration module (BRM) to recover the background image dynamically from the input video. BRM is extremely lightweight and can be easily integrated into existing matting models. By combining BRM with a recent image matting model, MODNet, we then present MODNet-V for portrait video matting. Benefited from the strong background prior provided by BRM, MODNet-V has only 1/3 of the parameters of MODNet but achieves comparable or even better performances. Our design allows MODNet-V to be trained in an end-to-end manner on a single NVIDIA 3090 GPU. Finally, we introduce a new patch refinement module (PRM) to adapt MODNet-V for high-resolution videos while keeping MODNet-V lightweight and fast.

研究动机与目标

  • 解决在实时应用中因用户提供的抠像图或背景图像不切实际而带来的肖像视频抠像挑战。
  • 消除对人工标注的抠像图或预先捕获的背景图像的依赖,这些在动态或实时场景中成本高昂且不可行。
  • 通过利用视频帧之间的时序一致性来重建动态背景先验,提升抠像性能与稳定性。
  • 开发一种轻量级、可端到端训练的模型,保持高效率与可扩展性,适用于高分辨率视频。

提出的方法

  • 提出一种背景恢复模块(BRM),通过保持潜在背景特征和二值掩码,迭代地从连续视频帧中更新并恢复背景。
  • 将BRM与MODNet集成,形成MODNet-V,其中恢复的背景作为每一帧中alpha抠像预测的动态先验。
  • 采用两阶段训练策略:首先在部分帧(第1帧和第T帧)上端到端训练MODNet与BRM,以减少显存占用;其次在高分辨率数据上微调补丁精炼模块(PRM)。
  • 引入一种补丁精炼模块(PRM),基于置信度阈值(ξ=0.01)选择性地精炼高分辨率补丁,使精炼开销降低约6.5倍。
  • 采用联合损失函数:ℒα用于alpha抠像预测,ℒbg用于监督背景重建,γ加权以突出边界区域。
  • 采用多尺度训练方案,使用每段视频序列包含20张背景图像的合成图像,提升对背景变化的鲁棒性。

实验结果

研究问题

  • RQ1能否从历史帧中有效恢复视频帧的背景,作为视频抠像的先验?
  • RQ2自监督的背景恢复机制能否优于依赖用户提供的先验(如抠像图或背景图像)的模型?
  • RQ3能否在不改变原有抠像模型架构的前提下,将轻量级的BRM模块集成到现有模型中,同时提升性能并减少模型大小?
  • RQ4所提出的PRM能否在不显著增加计算成本的前提下,实现高分辨率视频的高效且高质量推理?
  • RQ5BRM与PRM的结合是否能在多样化的现实世界视频序列中,带来更稳定、更准确的抠像结果?

主要发现

  • 在真实世界视频抠像数据集上,MODNet-V的MAD为65.63×10⁻⁴,MSE为32.39×10⁻⁴,优于MODNet(MAD:83.30×10⁻⁴,MSE:34.05×10⁻⁴)。
  • 尽管参数量仅为MODNet的1/3,MODNet-V仍实现了相当或更优的性能,展现出显著的参数效率。
  • 由于第一阶段训练中采用帧采样(第1帧和第T帧),MODNet-V可在单张NVIDIA 3090 GPU上以批量大小16实现端到端训练。
  • 补丁精炼模块(PRM)通过仅处理15%的高缺陷概率补丁(ξ=0.01),使精炼开销降低约6.5倍。
  • 视觉对比显示,MODNet-V生成的alpha抠像更稳定、更准确,尤其在发丝等复杂区域表现更优,得益于增强的背景先验。
  • BRM通过在帧间持续更新背景表征,有效处理动态背景,避免了在背景随时间变化的场景中失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。