Skip to main content
QUICK REVIEW

[论文解读] MODNet: Real-Time Trimap-Free Portrait Matting via Objective Decomposition

Zhanghan Ke, Jiayu Sun|arXiv (Cornell University)|Nov 24, 2020
Image Enhancement Techniques被引用 5
一句话总结

MODNet 是一种轻量级、实时的抠图网络,无需使用 trimap 或多阶段推理即可实现最先进性能。它通过单张输入图像,利用显式约束同时优化多个子目标,结合高效空洞空间金字塔池化(e-ASPP)模块与自监督子目标一致性(SOC)策略,提升效率与鲁棒性,在 1080Ti GPU 上实现 67 FPS 的推理速度,并在 Adobe 和新提出的 PPM-100 基准测试中超越以往无需 trimap 的方法。

ABSTRACT

Existing portrait matting methods either require auxiliary inputs that are costly to obtain or involve multiple stages that are computationally expensive, making them less suitable for real-time applications. In this work, we present a light-weight matting objective decomposition network (MODNet) for portrait matting in real-time with a single input image. The key idea behind our efficient design is by optimizing a series of sub-objectives simultaneously via explicit constraints. In addition, MODNet includes two novel techniques for improving model efficiency and robustness. First, an Efficient Atrous Spatial Pyramid Pooling (e-ASPP) module is introduced to fuse multi-scale features for semantic estimation. Second, a self-supervised sub-objectives consistency (SOC) strategy is proposed to adapt MODNet to real-world data to address the domain shift problem common to trimap-free methods. MODNet is easy to be trained in an end-to-end manner. It is much faster than contemporaneous methods and runs at 67 frames per second on a 1080Ti GPU. Experiments show that MODNet outperforms prior trimap-free methods by a large margin on both Adobe Matting Dataset and a carefully designed photographic portrait matting (PPM-100) benchmark proposed by us. Further, MODNet achieves remarkable results on daily photos and videos. Our code and models are available at https://github.com/ZHKKKe/MODNet, and the PPM-100 benchmark is released at https://github.com/ZHKKKe/PPM.

研究动机与目标

  • 开发一种实时、无需 trimap 的人像抠图方法,避免使用昂贵的辅助输入和多阶段流水线。
  • 通过提升对真实世界数据的泛化能力,解决无需 trimap 抠图中的领域偏移问题。
  • 设计一种轻量级、单阶段网络,同时优化多个抠图子目标,以提升效率与精度。
  • 建立一个新的高质量基准(PPM-100),用于公正评估无需 trimap 的人像抠图方法。

提出的方法

  • MODNet 使用显式约束,在仅输入单张 RGB 图像的单阶段架构中,同时优化多个抠图子目标(如前景、背景和 alpha 预测)。
  • 提出一种高效空洞空间金字塔池化(e-ASPP)模块,将参数量和 FLOPs 降低至标准 ASPP 的 1%,同时保持相近的多尺度特征融合性能。
  • e-ASPP 模块通过通道压缩、多尺度特征提取、特征融合与通道间融合,加速语义估计。
  • 提出一种自监督子目标一致性(SOC)策略,在训练过程中强制预测的子目标之间保持一致性,从而提升模型鲁棒性,减轻领域偏移影响。
  • 模型采用端到端训练,实现高效优化,无需复杂流水线或辅助监督。
  • 该方法在 Adobe Matting 数据集和为多样化真实世界人像图像专门设计的新基准 PPM-100 上进行评估。

实验结果

研究问题

  • RQ1单阶段、无需 trimap 的人像抠图网络能否在保持高精度的同时实现实时推理?
  • RQ2如何在不牺牲语义表征能力的前提下,使多尺度特征融合更加高效?
  • RQ3子目标之间的自监督一致性能否提升对真实世界数据的泛化能力并减少领域偏移?
  • RQ4与现有无需 trimap 和多阶段方法相比,该方法在速度、精度和鲁棒性方面表现如何?
  • RQ5新的高质量基准能否提升人像抠图评估的公平性与可复现性?

主要发现

  • 在 512×512 输入下,MODNet 在 GTX 1080Ti GPU 上实现 67 帧每秒的推理速度,显著快于同期方法。
  • 在 Adobe Matting 数据集上,MODNet 的均方误差(MSE)为 0.0082,平均绝对差(MAD)为 0.0157,优于以往无需 trimap 的方法。
  • 通过自监督 SOC 策略,MODNet 在 CRGNN-R 基准上的 MSE 降低至 0.0033,MAD 降低至 0.0084,展现出更强的鲁棒性。
  • 在新提出的 PPM-100 基准上,MODNet 达到最先进性能,验证了其在多样化真实世界人像图像上的有效性。
  • 由于对背景变化具有更强鲁棒性,MODNet 在动态场景(如移动物体进入背景)中优于背景抠图(BM)方法。
  • e-ASPP 模块将参数量和 FLOPs 降低至标准 ASPP 的 1%,同时保持优异性能,证明了其高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。