Skip to main content
QUICK REVIEW

[论文解读] Real-Time High-Resolution Background Matting

Shanchuan Lin, Andrey Ryabtsev|arXiv (Cornell University)|Dec 14, 2020
Image Enhancement Techniques参考文献 19被引用 11
一句话总结

本文提出了一种实时、高分辨率的背景抠像方法,通过两阶段神经网络实现:在4K分辨率下达到30fps,在HD分辨率下达到60fps。该方法采用低分辨率基础网络进行误差预测,仅对关键区域应用高分辨率优化网络。该方法在质量和速度方面均达到新的最先进水平,利用两个新构建的大规模数据集——VideoMatte240K 和 PhotoMatte13K/85——在色键抠像基础上进行训练,实现稳健的泛化能力。

ABSTRACT

We introduce a real-time, high-resolution background replacement technique which operates at 30fps in 4K resolution, and 60fps for HD on a modern GPU. Our technique is based on background matting, where an additional frame of the background is captured and used in recovering the alpha matte and the foreground layer. The main challenge is to compute a high-quality alpha matte, preserving strand-level hair details, while processing high-resolution images in real-time. To achieve this goal, we employ two neural networks; a base network computes a low-resolution result which is refined by a second network operating at high-resolution on selective patches. We introduce two largescale video and image matting datasets: VideoMatte240K and PhotoMatte13K/85. Our approach yields higher quality results compared to the previous state-of-the-art in background matting, while simultaneously yielding a dramatic boost in both speed and resolution.

研究动机与目标

  • 为无需绿幕的实用视频会议应用实现实时、高分辨率的背景抠像。
  • 解决在4K和HD视频实时处理中保留发丝等细粒度细节的挑战。
  • 克服先前方法在速度、分辨率或需要手动Trimap标注方面的局限性。
  • 开发一种可扩展、端到端可训练的系统,适用于多样化的身体姿态和背景场景。

提出的方法

  • 采用两阶段神经网络架构:基础网络以低分辨率处理输入,预测粗略的alpha抠像和前景,而优化网络仅在全分辨率下对高误差区域进行增强。
  • 基础网络输出误差预测图,识别需要高分辨率优化的图像块,从而最小化冗余计算。
  • 优化网络采用感受野为13×13的3×3卷积堆叠结构,提升选定区域的细节锐度,优于基于点的1×1卷积核优化。
  • 该方法在两个新构建的大规模数据集上进行训练——VideoMatte240K(24万帧视频)和 PhotoMatte13K/85(1.3万张图像)——其高质量alpha抠像通过色键软件提取。
  • 训练流程结合了来自这些数据集的多样化、高分辨率数据与人工精心筛选的数据集,以提升泛化能力和细粒度细节学习。
  • 通过仅将高分辨率优化限制在图像区域的5–10%以内,系统在现代GPU上实现推理速度优化,达到实时性能。
(a) VideoMatte240K
(a) VideoMatte240K

实验结果

研究问题

  • RQ1是否可以实现完全自动化的实时背景抠像系统,在无需手动Trimap输入或绿幕的情况下,达到4K分辨率下的高质量结果?
  • RQ2在实时视频处理中,如何高效地保留高分辨率细节,特别是发丝等精细结构?
  • RQ3大规模、高质量数据集在提升真实世界抠像场景中泛化能力和性能方面发挥什么作用?
  • RQ4与全图优化相比,选择性、基于图像块的优化是否能在保持保真度的同时,实现更高的速度和质量?

主要发现

  • 所提方法在现代GPU上实现4K分辨率下30fps、HD分辨率下60fps的性能,显著优于先前最先进方法。
  • 在Distinctions测试集上,该方法SAD为9.19,MSE为7.08,Grad为6345,Conn为7216,优于BGM(SAD: 16.07,MSE: 21.00)及其他基线方法。
  • 从训练中移除VideoMatte240K、PhotoMatte13K或Distinctions数据集会导致性能明显下降,证实了这些数据集对模型质量的贡献。
  • 仅对图像区域的5–10%进行优化可实现速度与质量的最佳平衡;当对整个图像进行优化时,推理速度降至42.8fps(全4K分辨率)。
  • 由于感受野更大,优化网络中的3×3卷积核优于1×1卷积核,显著提升了细节锐度。
  • 失败案例出现在主体在背景上投下阴影、背景颜色与主体匹配,或背景高度纹理化的情况下,表明在这些场景下仍存在局限性。
(b) PhotoMatte13K/85
(b) PhotoMatte13K/85

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。