Skip to main content
QUICK REVIEW

[论文解读] Lightweight Real-time Makeup Try-on in Mobile Browsers with Tiny CNN Models for Facial Tracking

Tianxing Li, Zhi Yu|arXiv (Cornell University)|Jun 5, 2019
Face recognition and analysis参考文献 23被引用 6
一句话总结

本文提出一种轻量级、两阶段的CNN架构,用于在移动浏览器中实现实时面部关键点检测,通过使用感兴趣区域(RoI)处理的从粗到精的热力图回归,在计算成本极低的情况下实现高精度。该方法在其自定义数据集上达到3.21的归一化均方误差,并通过客户端推理在智能手机上实现了实时虚拟试妆,模型大小仅为607KB。

ABSTRACT

Recent works on convolutional neural networks (CNNs) for facial alignment have demonstrated unprecedented accuracy on a variety of large, publicly available datasets. However, the developed models are often both cumbersome and computationally expensive, and are not adapted to applications on resource restricted devices. In this work, we look into developing and training compact facial alignment models that feature fast inference speed and small deployment size, making them suitable for applications on the aforementioned category of devices. Our main contribution lies in designing such small models while maintaining high accuracy of facial alignment. The models we propose make use of light CNN architectures adapted to the facial alignment problem for accurate two-stage prediction of facial landmark coordinates from low-resolution output heatmaps. We further combine the developed facial tracker with a rendering method, and build a real-time makeup try-on demo that runs client-side in smartphone Web browsers. More results and demo are in our project page: http://research.modiface.com/makeup-try-on-cvprw2019/

研究动机与目标

  • 开发一种适用于资源受限的移动和网络平台实时推理的紧凑面部对齐模型。
  • 解决在客户端网络应用中平衡高关键点检测精度与小模型尺寸及快速推理速度的挑战。
  • 通过使用两阶段从粗到精的预测与基于RoI的特征处理及轻量级CNN架构,优化模型效率。
  • 实现实时、基于浏览器的虚拟试妆,无需服务端计算,确保低延迟和快速加载。
  • 在正面及近正面人脸(虚拟试妆应用中常见)上保持高精度。

提出的方法

  • 设计两阶段CNN:第一阶段生成低分辨率热力图以实现粗略关键点预测,第二阶段利用从共享卷积特征中提取的RoI对坐标进行精细化。
  • 使用受MobileNetV2启发的倒残差模块,结合深度可分离卷积,以最小化参数量和乘加操作数。
  • 采用带Sigmoid交叉熵损失的热力图回归,并引入带空间加权的$L_2$距离损失,以提升边界关键点的精度。
  • 采用RoI对齐技术,从感兴趣区域精确提取特征,减少计算量的同时保持空间精度。
  • 通过降低输入分辨率和减少网络通道数(如$α=0.5$)优化推理,且精度下降不明显。
  • 将训练好的关键点检测器集成到客户端渲染流水线中,实现在网络浏览器中的实时虚拟试妆。

实验结果

研究问题

  • RQ1紧凑的CNN架构是否能在移动设备上实现子20ms推理时间的同时保持高面部关键点检测精度?
  • RQ2基于RoI处理的两阶段从粗到精热力图回归在不牺牲精度的前提下,是否能有效降低计算负载?
  • RQ3在正面人脸姿态下,通过通道缩放或输入分辨率降低等方式,模型尺寸可压缩到何种程度而仍能保持性能?
  • RQ4与SOTA模型Look at Boundary(LAB)相比,该方法在标准基准测试中在精度和效率方面表现如何?
  • RQ5能否使用600KB左右的模型构建一个完全基于客户端、浏览器端的虚拟试妆系统,实现低延迟和快速加载?

主要发现

  • 完整模型在包含65个关键点的自定义数据集上达到3.21的归一化均方误差,表明其适用于实时应用的高精度。
  • 消融实验证实,所有组件——热力图损失、$L_2$损失以及第二阶段处理——均至关重要,移除任一组件均导致性能下降0.3至1.2分。
  • 当$α=0.5$(通道数减半)时,模型在300W Common子集上仍保持3.43的误差,表明对模型压缩具有鲁棒性。
  • 模型大小缩减至607KB,计算量为173.69M MAdd,FLOPs为90.75M,可在iPhone XR上实现20ms推理。
  • 在300W数据集上,模型在Common子集上的表现与LAB(4-stack)相当(3.42 vs. 3.42),但在Fullset上略有下降(4.42 vs. 4.12),表明在未遮挡正面人脸上的对齐能力更优。
  • 进一步降低输入分辨率和模型尺寸(如至607KB)仅导致精度轻微下降,证实其适用于移动和网络部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。