[论文解读] Fast Deep Matting for Portrait Animation on Mobile Phone
本文提出了一种用于移动端人像动画的实时、自动深度抠像方法,采用轻量级全卷积网络结合密集连接与空洞卷积,生成粗略二值掩码,随后通过可学习的柔化模块应用边缘保持、抠像自适应的引导滤波,生成高质量的 alpha 掩码。该系统在移动设备上实现 15 fps 的性能,效果与最先进方法相当,实现了无需用户交互的实时人像动画。
Image matting plays an important role in image and video editing. However, the formulation of image matting is inherently ill-posed. Traditional methods usually employ interaction to deal with the image matting problem with trimaps and strokes, and cannot run on the mobile phone in real-time. In this paper, we propose a real-time automatic deep matting approach for mobile devices. By leveraging the densely connected blocks and the dilated convolution, a light full convolutional network is designed to predict a coarse binary mask for portrait images. And a feathering block, which is edge-preserving and matting adaptive, is further developed to learn the guided filter and transform the binary mask into alpha matte. Finally, an automatic portrait animation system based on fast deep matting is built on mobile devices, which does not need any interaction and can realize real-time matting with 15 fps. The experiments show that the proposed approach achieves comparable results with the state-of-the-art matting solvers.
研究动机与目标
- 在移动设备上实现无需用户交互的实时图像与视频抠像。
- 克服需要裁剪图或笔画的交互式抠像方法的局限性,这些方法在移动设备上部署速度过慢。
- 开发一种轻量级、端到端的深度学习框架,适用于移动推理,兼具高速度与高精度。
- 实现对头发和颈部等复杂区域的精确抠像,这些区域对现有方法而言极具挑战。
- 构建一个完全自动的人像动画系统,可在移动硬件上实时运行。
提出的方法
- 使用轻量级全卷积网络,结合密集连接块与空洞卷积,从人像图像中预测粗略二值掩码。
- 网络端到端训练以分割前景与背景,通过下采样降低计算负载。
- 提出一种新型柔化模块,可学习具有抠像自适应权重的引导滤波,将二值掩码细化为平滑且边缘保持的 alpha 掩码。
- 柔化模块通过训练过程中学习的滤波权重,对粗略掩码执行线性变换,实现快速推理。
- 通过 GPU 与 CPU 推理优化整个框架,进一步利用 Android 上的渲染脚本优化实现额外加速。
- 将系统集成至移动端实时人像动画应用,实现 15 fps 的图像处理速度。
实验结果
研究问题
- RQ1完全自动的深度学习方法是否能在移动设备上实现无需用户交互的实时抠像?
- RQ2具有密集连接与空洞卷积的轻量级网络是否能为人物图像生成准确的粗略分割?
- RQ3可学习的、边缘保持的引导滤波是否能有效将二值掩码细化为高质量 alpha 掩码?
- RQ4与现有最先进抠像求解器相比,该方法在移动硬件上的速度与精度表现如何?
- RQ5该方法是否能比现有自动抠像技术更精确地处理头发与颈部等复杂区域?
主要发现
- 所提方法在移动设备上实现 15 fps,实现无需用户交互的实时人像动画。
- 在高通骁龙 820 上,GPU 推理耗时 62ms,CPU 推理耗时 140ms,展现出强大的移动端效率。
- 与 Shen 等人(2016b)的基线自动抠像方法相比,GPU 推理时间减少 587ms,CPU 推理时间减少 5962ms。
- 与最先进基线相比,梯度误差仅增加 4.37×10⁻³,表明抠像质量相当。
- 在处理复杂情况(如背景颜色相近、衣领与肩膀等细节)方面,系统优于实时应用 Fabby。
- 柔化模块展现出抠像自适应行为,能够精确分离头部与颈部区域,这在其他方法中较为罕见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。