Skip to main content
QUICK REVIEW

[论文解读] Inductive Guided Filter: Real-time Deep Image Matting with Weakly Annotated Masks on Mobile Devices

Yaoyi Li, Jianfu Zhang|arXiv (Cornell University)|May 16, 2019
Image Enhancement Techniques参考文献 36被引用 4
一句话总结

本文提出了一种名为归纳引导滤波(Inductive Guided Filter)的实时深度图像抠图方法,适用于移动设备,采用轻量级沙漏网络,以弱标注掩码为输入来参数化引导滤波。该方法引入了Gabor损失以增强纹理建模能力,实现了高精度与高速度,在GPU上推理速度超过5000 FPS,在iPhone SE上耗时低于26ms,相较于先前方法在效率和对噪声掩码的鲁棒性方面表现更优。

ABSTRACT

Recently, significant progress has been achieved in deep image matting. Most of the classical image matting methods are time-consuming and require an ideal trimap which is difficult to attain in practice. A high efficient image matting method based on a weakly annotated mask is in demand for mobile applications. In this paper, we propose a novel method based on Deep Learning and Guided Filter, called Inductive Guided Filter, which can tackle the real-time general image matting task on mobile devices. We design a lightweight hourglass network to parameterize the original Guided Filter method that takes an image and a weakly annotated mask as input. Further, the use of Gabor loss is proposed for training networks for complicated textures in image matting. Moreover, we create an image matting dataset MAT-2793 with a variety of foreground objects. Experimental results demonstrate that our proposed method massively reduces running time with robust accuracy.

研究动机与目标

  • 开发一种适用于移动设备部署的实时高效深度图像抠图框架。
  • 通过在弱标注掩码下实现鲁棒性能,降低对高质量三值图的依赖。
  • 通过新型损失函数提升抠图中的纹理细节保留能力。
  • 构建大规模、多样化的图像抠图数据集(MAT-2793),用于训练与评估。
  • 在移动设备与边缘设备上实现高推理速度而不牺牲精度。

提出的方法

  • 设计了一种轻量级沙漏网络,用于参数化原始引导滤波,支持以图像和掩码为输入的端到端学习。
  • 模型采用双分支结构,共享单一轻量级主干网络,用于预测用于alpha抠图估计的线性系数A和B。
  • 提出一种新型Gabor损失,通过应用一组Gabor滤波器提取高频纹理特征,提升细节保真度。
  • 采用基于GAN的训练框架,结合对抗性损失、L1损失与所提出的Gabor损失,以增强结果的真实感与细节表现。
  • 推理阶段采用下采样因子为4的快速引导滤波版本,以实现加速,同时保持原始滤波器的高效特性。
  • 通过在前景掩码上进行随机膨胀与腐蚀操作,生成弱标注掩码,模拟真实用户输入中的噪声。

实验结果

研究问题

  • RQ1基于深度学习的方法能否在移动设备上实现图像抠图的实时推理?
  • RQ2如何使模型在无需精确三值图的情况下,对弱标注掩码保持鲁棒性?
  • RQ3基于Gabor滤波器的新型损失函数能否提升图像抠图中的纹理细节保留能力?
  • RQ4在移动硬件上,轻量级架构能达到怎样的性能与速度水平?
  • RQ5与当前最先进模型相比,该方法在精度与推理延迟方面表现如何?

主要发现

  • 所提方法在单张NVIDIA V100 GPU上,批量大小为256时,推理速度超过5000 FPS,证明了其实时处理能力。
  • 在iPhone SE(2016)上,每张图像推理耗时25.9ms,实现了生产环境下的实时性能。
  • 该模型在MAT-2793与Adobe Composition-1k数据集上均表现出鲁棒性能,即使在噪声或不精确的输入掩码下亦表现稳定。
  • 定性对比显示,Gabor损失显著提升了纹理细节的保留能力。
  • 该方法在速度上优于Adobe DIM及其他SOTA模型,同时保持了具有竞争力的精度,尤其在弱标注掩码场景下优势明显。
  • MAT-2793数据集包含2793个多样化的前景物体,是迄今为止公开的最大规模图像抠图数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。