[论文解读] Learning deep representation from coarse to fine for face alignment
本文提出一种用于人脸对齐的深度卷积网络粗到细训练策略,将关键点划分为主要(如眼睛、鼻子、嘴巴)和复杂子集。通过逐步将训练重点从主要关键点转移到复杂关键点,该方法实现了更平滑的优化并提高了鲁棒性,在COFW数据集上相比之前最先进方法将平均误差降低了21.37%。
In this paper, we propose a novel face alignment method that trains deep convolutional network from coarse to fine. It divides given landmarks into principal subset and elaborate subset. We firstly keep a large weight for principal subset to make our network primarily predict their locations while slightly take elaborate subset into account. Next the weight of principal subset is gradually decreased until two subsets have equivalent weights. This process contributes to learn a good initial model and search the optimal model smoothly to avoid missing fairly good intermediate models in subsequent procedures. On the challenging COFW dataset [1], our method achieves 6.33% mean error with a reduction of 21.37% compared with the best previous result [2].
研究动机与目标
- 解决在严重遮挡和姿态变化下实现鲁棒人脸关键点检测的挑战。
- 克服直接端到端训练的局限性,后者在优化过程中可能错过良好的中间模型。
- 通过优先初始关注关键面部关键点来结构化训练,提升模型泛化能力和收敛性。
- 实现在不依赖预训练或辅助属性标注的情况下,平滑搜索最优模型。
- 在基准数据集上实现最先进性能,尤其在遮挡等挑战性条件下表现优异。
提出的方法
- 将人脸关键点划分为一个主要子集(12个关键点:眉/眼角、鼻尖、嘴角、下颌尖)和一个复杂子集。
- 引入一种动态损失加权方案,其中主要子集的损失初始权重较高(λ ≈ 1),并逐步降低至0.5。
- 采用线性递减的训练调度策略,将λ从初始值逐步降低至0.5,实现从粗到细学习的平滑过渡。
- 通过在四个最大池化层而非仅最终层添加监督信号,实现多层次监督,以改善特征学习。
- 使用数据增强技术,缓解因训练数据有限导致的过拟合问题。
- 端到端训练单一深度卷积网络,无需初始化或预训练,仅使用原始人脸图像作为输入。
实验结果
研究问题
- RQ1粗到细的训练策略是否能提升深度人脸对齐在遮挡情况下的鲁棒性和准确性?
- RQ2逐步将训练重点从主要关键点转移到复杂关键点,是否能带来更好的收敛性并避免次优模型?
- RQ3单一深度网络是否能在不依赖辅助属性标注的情况下,超越多阶段或预训练模型?
- RQ4与固定权重或标准训练相比,动态损失加权在最终对齐精度方面表现如何?
- RQ5多层次监督在多大程度上增强了人脸对齐网络的特征表示能力?
主要发现
- 所提出的粗到细训练(CFT)方法在COFW数据集上相比之前最先进方法(TCDCN)将平均误差降低了21.37%。
- 在COFW上,CFT相比直接训练(DT)提升6.22%;在300-W上提升6.55%;在Helen上提升8.65%,表明在多个基准上均保持一致的性能增益。
- 在具有遮挡的挑战性COFW子集上,CFT显著优于使用预训练和属性监督的TCDCN,表明其具备更强的鲁棒性。
- 在严重遮挡和姿态变化条件下,CFT在COFW上的平均误差为6.33%(以瞳孔间距归一化)。
- 可视化结果表明,CFT在处理部分遮挡和极端表情等复杂情况时,比RCPR及其他基线方法更为准确。
- 该模型在CPU上处理单张图像耗时65ms,虽慢于TCDCN(18ms),但性能提升足以弥补复杂度的增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。