Skip to main content
QUICK REVIEW

[论文解读] Hybrid coarse-fine classification for head pose estimation

Haofan Wang, Zhenghua Chen|arXiv (Cornell University)|Jan 21, 2019
Face recognition and analysis参考文献 20被引用 11
一句话总结

该论文提出了一种基于深度卷积神经网络的无地标头姿态估计混合粗细分类框架,其中严格细粒度分类可减少粗粒度分箱带来的量化误差,且集成回归进一步提升了精度。在BIWI和AFLW2000数据集上实现了最先进性能,AFLW2000上的平均绝对误差(MAE)为5.395°,BIWI上的MAE为3.017°。

ABSTRACT

Head pose estimation, which computes the intrinsic Euler angles (yaw, pitch, roll) from the human, is crucial for gaze estimation, face alignment, and 3D reconstruction. Traditional approaches heavily relies on the accuracy of facial landmarks. It limits their performances, especially when the visibility of the face is not in good condition. In this paper, to do the estimation without facial landmarks, we combine the coarse and fine regression output together for a deep network. Utilizing more quantization units for the angles, a fine classifier is trained with the help of other auxiliary coarse units. Integrating regression is adopted to get the final prediction. The proposed approach is evaluated on three challenging benchmarks. It achieves the state-of-the-art on AFLW2000, BIWI and performs favorably on AFLW. The code has been released on Github.

研究动机与目标

  • 解决基于地标头姿态估计的局限性,特别是在面部地标检测失败的低可见度条件下。
  • 克服先前无地标方法中依赖多损失训练时粗粒度分箱分类引入的量化误差。
  • 通过引入分层分类机制,对细粒度分箱施加更严格约束,以提升基于回归的头姿态估计精度。
  • 在不依赖2D面部地标的情况下,在基准数据集上实现最先进性能,提升真实场景下的鲁棒性。

提出的方法

  • 提出一种混合粗细分类框架,多个分类头并行训练:用于偏航、俯仰和翻滚角的粗分类(198、66、18、6、2类)和细分类(198类)。
  • 使用共享的ResNet-50主干网络提取特征,随后为每个角度分别设置全连接分支,并配备多级分类头。
  • 采用多任务损失函数,结合回归损失(L1)和分类交叉熵损失,并通过自适应加权平衡粗分类、细分类和回归组件。
  • 通过融合细分类头和回归头的输出来整合最终预测结果,利用细分类器的高分辨率输出对回归结果进行精细化修正。
  • 使用Adam优化器进行训练,初始学习率固定为1e-6,采用ImageNet归一化,并丢弃角度超出±99°的图像。
  • 通过消融研究调优不同分类与回归组件的损失权重系数(α, β₁, β₂, β₃, β₄, β₅)。

实验结果

研究问题

  • RQ1与单阶段分类相比,混合粗细分类框架是否能减少无地标头姿态估计中的量化误差?
  • RQ2对细粒度分类施加更严格约束是否能提升基于回归的头姿态估计精度?
  • RQ3所提方法在BIWI、AFLW2000和AFLW等标准基准上与最先进基于地标和无地标方法相比表现如何?
  • RQ4在多任务训练方案中,平衡粗分类、细分类和回归的最优损失权重配置是什么?
  • RQ5该混合分类框架是否可泛化至其他具有离散量化需求的回归任务?

主要发现

  • 所提方法在AFLW2000数据集上达到5.395°的平均绝对误差(MAE),优于先前最先进方法(如Ruiz等人[1]的6.155° MAE)。
  • 在BIWI数据集上,方法实现3.017°的MAE,显著优于基线方法[1](4.895°),甚至超过基于地标的方法(如CNN + Heatmap,3.23°)。
  • 在AFLW数据集上,方法实现5.090°的MAE,性能强劲,与最佳无地标及基于地标方法相当。
  • 消融研究显示,最优损失权重为α=2, β₁=7, β₂=5, β₃=3, β₄=1, β₅=1,在AFLW2000上实现最低MAE(5.3953)。
  • 该方法在受控环境(BIWI)和野外场景(AFLW2000)中均表现出鲁棒性,证实了混合分类设计的有效性。
  • 细粒度分类头(198类)相比粗粒度分箱显著降低误差,验证了在回归前强化分类精度设计选择的合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。