Skip to main content
QUICK REVIEW

[论文解读] Attention Mesh: High-fidelity Face Mesh Prediction in Real-time

Ivan Grishchenko, Artsiom Ablavatski|arXiv (Cornell University)|Jun 19, 2020
Face recognition and analysis参考文献 8被引用 51
一句话总结

Attention Mesh 是一个统一的、轻量级模型,利用区域聚焦的头部通过空间变换器预测 3D 面部网格,在移动设备上实现级联级别的准确性并具备更快的设备端性能(>50 FPS)。

ABSTRACT

We present Attention Mesh, a lightweight architecture for 3D face mesh prediction that uses attention to semantically meaningful regions. Our neural network is designed for real-time on-device inference and runs at over 50 FPS on a Pixel 2 phone. Our solution enables applications like AR makeup, eye tracking and AR puppeteering that rely on highly accurate landmarks for eye and lips regions. Our main contribution is a unified network architecture that achieves the same accuracy on facial landmarks as a multi-stage cascaded approach, while being 30 percent faster.

研究动机与目标

  • 推动用于设备端 AR 应用(妆容、木偶表演、眼动追踪)的高质量 3D 面部网格预测。
  • 通过引入具有区域特定头部的统一架构,消除对多阶段级联的需求。
  • 在显著区域(眼睛和嘴唇)实现高精度,同时在移动 GPU 上保持实时性能。
  • 展示可训练的注意力机制,将计算聚焦于语义上有意义的面部区域。

提出的方法

  • 将 256x256 图像输入处理为 64x64 特征图。
  • 通过基子模型预测所有 478 个 3D 面部网格landmark 及感兴趣区域的裁剪边界。
  • 使用区域特定子模型从 24x24 的注意力裁剪特征预测眼睛、虹膜和嘴唇。
  • 使用 Spatial Transformer 通过仿射变换 θ 从 64x64 映射中提取区域特征。
  • 分两个阶段进行训练:(i) 使用理想的地面真值裁剪进行独立训练,(ii) 使用模型预测的裁剪进行训练。
  • 可选地包含一个两阶段推理流水线,通过在 GPU 上完成整线过程来减少 CPU-GPU 同步。

实验结果

研究问题

  • RQ1单一的统一模型是否能达到高保真面部网格的级联区域特定标记系统的准确性?
  • RQ2将区域特定头部与注意力结合是否能提升嘴唇和眼睛区域的性能而不牺牲整体速度?
  • RQ3在移动 GPU 上使用端到端基于注意力的网格时,设备端性能提升是多少?
  • RQ4与级联模型相比,Attention Mesh 在嘴唇、眼睛和虹膜区域的标记准确性表现如何?

主要发现

  • Attention Mesh 在典型的现代移动设备上比独立面部与区域模型的级联快 25% 以上。
  • Pixel 2XL 上的整体推理时间:全模型 16.6 ms;区域子模型分别为 4.18 ms(嘴唇)和 4.70 ms(眼睛与虹膜)。
  • 对所有点的平均归一化二维特征点误差(以 3D 间睑距标准化)为:All: 3.11(Attention Mesh)对比 2.99(All)对于 Mesh 与 Cascade 的合并结果;嘴唇:2.89(Attention Mesh)对比 2.70(Cascade);眼睛:6.04(Attention Mesh)对比 6.28(Cascade)。
  • Attention Mesh 在嘴唇区域的精度与级联相当,并且在眼部区域的性能有所提升。
  • 该模型支持实时 AR 应用,如口红渲染和木偶表演,具备更易于训练与分发的统一架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。