[论文解读] Highly Efficient Natural Image Matting
本文提出了一种无需trimap的轻量化自然图像抠图方法,采用两阶段框架:分割网络(SN)用于语义分类,抠图优化网络(MRN)用于预测alpha值。该方法引入了跨层级特征融合模块(CFM)以实现高效的多尺度特征提取,并设计了高效非局部注意力(ENA)模块以建模长距离依赖关系,在基准数据集上仅用344k参数即达到SOTA性能——仅为大型模型参数量的1%。
Over the last few years, deep learning based approaches have achieved outstanding improvements in natural image matting. However, there are still two drawbacks that impede the widespread application of image matting: the reliance on user-provided trimaps and the heavy model sizes. In this paper, we propose a trimap-free natural image matting method with a lightweight model. With a lightweight basic convolution block, we build a two-stages framework: Segmentation Network (SN) is designed to capture sufficient semantics and classify the pixels into unknown, foreground and background regions; Matting Refine Network (MRN) aims at capturing detailed texture information and regressing accurate alpha values. With the proposed cross-level fusion Module (CFM), SN can efficiently utilize multi-scale features with less computational cost. Efficient non-local attention module (ENA) in MRN can efficiently model the relevance between different pixels and help regress high-quality alpha values. Utilizing these techniques, we construct an extremely light-weighted model, which achieves comparable performance with ~1\% parameters (344k) of large models on popular natural image matting benchmarks.
研究动机与目标
- 解决基于深度学习的抠图方法依赖用户提供的trimap且模型参数量过大的问题。
- 通过减小模型尺寸与计算成本,实现图像抠图在低资源设备上的实用化部署。
- 开发一种无需trimap的端到端框架,同时完成图像区域分割与精确alpha值回归。
- 设计高效模块,在保持高性能的同时最小化参数量与FLOPs。
提出的方法
- 该框架包含两个阶段:使用轻量化主干网络的分割网络(SN),用于将像素分类为前景、背景和未知区域。
- 抠图优化网络(MRN)通过利用细节纹理信息,对未知区域的alpha值进行精细化优化。
- 跨层级特征融合模块(CFM)使SN能够以较低计算成本高效聚合多尺度特征。
- MRN中的高效非局部注意力(ENA)模块通过稀疏采样建模长距离像素关系,提升alpha预测精度。
- ENA采用采样间隔√k = 4,实现长距离建模效率与计算效率的平衡。
- 模型采用轻量化主干网络进行端到端训练,该主干网络专为语义表征与低FLOPs设计。
实验结果
研究问题
- RQ1无需trimap的自然图像抠图模型能否在显著减小模型尺寸的前提下实现SOTA性能?
- RQ2在轻量化网络中如何高效融合多尺度特征以提升语义理解能力?
- RQ3高效的注意力机制能否在不增加计算成本的前提下有效建模抠图中的长距离依赖关系?
- RQ4在抠图任务中,模型容量、参数量与推理效率之间的最优权衡是什么?
主要发现
- 所提模型在Composition-1k基准测试中SAD达到19.59,仅使用344k参数即超越SOTA方法。
- 模型仅消耗0.93G FLOPs,仅为大型模型FLOPs的1%,同时保持高精度。
- 与基线相比,ENA模块将SAD从34.33降低至19.59,证明其在建模长距离依赖方面的有效性。
- 将主干网络替换为MobileNetV2或ShuffleNetV2后,SAD分别升至47.21与48.72,FLOPs也更高,证实所提轻量化主干网络的优越性。
- 消融实验证实,CFM与异构注意力(ENA)联合使用时性能最佳,SAD相比基线降低46.3%。
- 该模型在真实互联网图像上泛化能力良好,能生成具有清晰前景边界与平滑过渡的高质量alpha抠图。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。