[论文解读] Towards Real-Time Automatic Portrait Matting on Mobile Devices
本文提出MMNet,一种轻量级、实时的移动端人像抠图模型,采用多分支空洞卷积和线性瓶颈模块。其在小米Mi 5上实现30 FPS的推理速度,仅比最先进模型多15%的梯度误差,且参数量比Mobile DeepLabv3少一个数量级。
We tackle the problem of automatic portrait matting on mobile devices. The proposed model is aimed at attaining real-time inference on mobile devices with minimal degradation of model performance. Our model MMNet, based on multi-branch dilated convolution with linear bottleneck blocks, outperforms the state-of-the-art model and is orders of magnitude faster. The model can be accelerated four times to attain 30 FPS on Xiaomi Mi 5 device with moderate increase in the gradient error. Under the same conditions, our model has an order of magnitude less number of parameters and is faster than Mobile DeepLabv3 while maintaining comparable performance. The accompanied implementation can be found at \url{https://github.com/hyperconnect/MMNet}.
研究动机与目标
- 解决在移动端实现自动人像抠图实时推理的挑战。
- 在不牺牲抠图质量的前提下,减少模型大小和计算成本。
- 克服现有方法依赖用户交互输入(如trimap或草图)的局限性。
- 设计一种紧凑的神经网络,在严格的延迟和参数约束下保持高性能。
- 实现在实际移动端应用(如照片编辑和视频处理)中部署实时人像抠图。
提出的方法
- 采用编码器-解码器架构并引入跳跃连接,以保留空间细节。
- 使用深度可分离卷积作为基础操作,以减少FLOPs和模型大小。
- 引入不同空洞率的多分支空洞卷积,高效捕捉多尺度上下文信息。
- 采用线性瓶颈模块,在保持效率的同时增强表征能力。
- 应用宽度乘数控制模型容量、延迟和参数量,以适应移动端部署。
- 引入新型梯度损失和多个辅助损失,以提升alpha抠图质量。
实验结果
研究问题
- RQ1紧凑的神经网络是否能在移动端实现人像抠图的实时推理,且性能损失可忽略?
- RQ2多分支空洞卷积与线性瓶颈模块在精度与效率之间是否具有良好的平衡效果?
- RQ3在移动端硬件上,模型大小、延迟与抠图质量之间的权衡关系如何?
- RQ4量化与模型压缩能在多大程度上提升推理速度,同时保持最小的精度损失?
- RQ5所提出的架构是否能泛化到其他图像抠图或视频抠图任务?
主要发现
- MMNet在小米Mi 5上实现30 FPS,仅比最先进模型多15%的梯度误差,实现了真正的实时性能。
- 该模型的参数量比Mobile DeepLabv3少一个数量级,同时保持了相当的性能。
- 8位量化使延迟降低25%,并略微改善了梯度误差,表明其对低精度推理具有鲁棒性。
- 消融实验证实,多分支空洞卷积和线性瓶颈模块对性能与效率至关重要。
- 在移动端设备上,该模型在延迟、参数量和梯度误差的帕累托前沿上优于所有先前方法。
- 代码实现已公开发布于 https://github.com/hyperconnect/MMNet,便于复现与进一步开发。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。