[论文解读] Joint Face Detection and Facial Motion Retargeting for Multiple Faces
本文提出一种端到端的深度学习网络,可联合检测多个面部并回归3D形态模型(3DMM)参数,实现实时面部动作重定向。通过利用在单张人脸数据上训练的解耦多尺度架构,并将弱监督的3DMM真实标签迁移至多张人脸图像,该方法在极端姿态和表情下仍保持高检测准确率(mAP 98.8%)与鲁棒性,其速度和内存效率优于级联方法。
Facial motion retargeting is an important problem in both computer graphics and vision, which involves capturing the performance of a human face and transferring it to another 3D character. Learning 3D morphable model (3DMM) parameters from 2D face images using convolutional neural networks is common in 2D face alignment, 3D face reconstruction etc. However, existing methods either require an additional face detection step before retargeting or use a cascade of separate networks to perform detection followed by retargeting in a sequence. In this paper, we present a single end-to-end network to jointly predict the bounding box locations and 3DMM parameters for multiple faces. First, we design a novel multitask learning framework that learns a disentangled representation of 3DMM parameters for a single face. Then, we leverage the trained single face model to generate ground truth 3DMM parameters for multiple faces to train another network that performs joint face detection and motion retargeting for images with multiple faces. Experimental results show that our joint detection and retargeting network has high face detection accuracy and is robust to extreme expressions and poses while being faster than state-of-the-art methods.
研究动机与目标
- 解决级联方法在面部动作重定向中分别执行面部检测与3DMM拟合所导致的效率低下与延迟问题。
- 通过使用单张人脸3DMM网络生成弱监督的3DMM真实标签,克服多张人脸数据集中缺乏3DMM参数标注的问题。
- 设计一种多任务学习框架,将3DMM参数(身份、表情、姿态、尺度)解耦,以提升表征学习能力与模型泛化性能。
- 通过最小化计算开销与内存使用,实现在移动平台上的实时轻量化面部动作重定向部署。
提出的方法
- 使用带有Fire模块和挤压-激励模块的多尺度架构训练单张人脸网络(SFN),从裁剪的单张人脸图像中回归解耦的3DMM参数。
- 设计SFN以强调高层特征用于姿态与尺度,多尺度特征用于身份与表情,从而实现更优的解耦效果。
- 利用训练好的SFN为多张人脸图像中的多个面部生成合成3DMM参数,为多张人脸网络(MFN)训练提供弱监督监督信号。
- 设计MFN为类似YOLO的单阶段检测器,通过一次前向传播同时预测面部边界框与3DMM参数。
- 在MFN中引入尺度先验与多尺度特征融合,以提升在极端姿态与表情下的检测鲁棒性与参数回归准确性。
- 通过检测与3DMM回归的联合训练,促使网络学习专属的面部特征,从而同时提升检测与重定向性能。
实验结果
研究问题
- RQ1能否通过单一深度学习网络联合检测多个面部并回归3DMM参数,实现实时面部动作重定向,且效率高于级联方法?
- RQ2在多任务学习框架中,如何实现3DMM参数的解耦预测,以提升对身份、表情与姿态变化的鲁棒性?
- RQ3当多张人脸数据集中无真实3DMM数据时,利用单张人脸模型生成的弱监督3DMM参数在多张人脸训练中的改进程度如何?
- RQ4与分别训练检测与3DMM回归相比,联合训练检测与3DMM回归是否能提升检测准确率与表情迁移质量?
- RQ5所提方法是否能在复杂、非受限环境下实现实时性能,同时保持高精度?
主要发现
- 所提出的MFN在AFW数据集上达到98.8%的平均精度(mAP),优于Hyperface(97.9%)与Faceness-Net(97.2%),且在相同设置下表现更优。
- 联合检测与重定向的网络将每帧推理时间缩短至39ms(无论面部数量多少),优于级联方法(单张脸需49ms,十张脸需184ms)。
- 通过将检测与重定向整合为单一网络,内存占用从13.5MB(独立检测器+SFN)降低至13MB。
- 多尺度SFN在眼睛表情上的2D关键点误差为0.016,前额愤怒表情误差为0.131,显著优于单尺度SFN(分别为0.082与0.331),证明了解耦性能的提升。
- 使用多尺度SFN生成的真实标签进行训练的MFN,其3D面部动作重定向精度(NME: 0.229)与SFN(0.229)相当,尽管训练数据来自多张人脸。
- 在300VW与WIDER数据集上的视觉结果表明,该方法对极端表情与姿态具有强鲁棒性,能实现准确的3D网格重建与边界框预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。