[论文解读] RankPose: Learning Generalised Feature with Rank Supervision for Head Pose Estimation
RankPose 通过在有界角度空间中使用余弦和反余弦变换重新表述姿态预测,并引入一种带有排序损失的孪生网络,以学习对身份和光照不变的通用姿态特定特征,提出了一种新颖的基于RGB图像的头部姿态估计深度学习方法。该方法在AFLW2000和BIWI数据集上实现了最先进性能,平均绝对误差(MAE)分别降低至3.66和3.71,相较于之前最先进方法分别提升了18.66%和7.25%。
We address the challenging problem of RGB image-based head pose estimation. We first reformulate head pose representation learning to constrain it to a bounded space. Head pose represented as vector projection or vector angles shows helpful to improving performance. Further, a ranking loss combined with MSE regression loss is proposed. The ranking loss supervises a neural network with paired samples of the same person and penalises incorrect ordering of pose prediction. Analysis on this new loss function suggests it contributes to a better local feature extractor, where features are generalised to Abstract Landmarks which are pose-related features instead of pose-irrelevant information such as identity, age, and lighting. Extensive experiments show that our method significantly outperforms the current state-of-the-art schemes on public datasets: AFLW2000 and BIWI. Our model achieves significant improvements over previous SOTA MAE on AFLW2000 and BIWI from 4.50 to 3.66 and from 4.0 to 3.71 respectively. Source code will be made available at: https://github.com/seathiefwang/RankHeadPose.
研究动机与目标
- 解决在2D RGB图像中进行头部姿态估计的挑战,该挑战受限于身份、光照和表情变化的影响。
- 通过学习对身份和光照等姿态无关因素不敏感的、与姿态相关的特征,提升特征的泛化能力。
- 设计一种损失函数,通过强制同一人图像对中姿态预测的相对顺序正确,增强局部特征的学习。
- 通过结合几何变换与基于排序的监督,实现在公开基准测试上的最先进性能。
提出的方法
- 通过将深层特征和输出权重进行L2归一化,将姿态预测重新表述为基于余弦相似度的角度估计,再通过反余弦函数实现转换。
- 采用孪生网络架构处理同一人的图像对,使模型能够在相似全局条件下比较姿态预测结果。
- 引入排序损失,对同一人图像对中预测角度顺序错误的情况进行惩罚,促使模型更关注与姿态相关的特征。
- 将排序损失与MSE回归损失结合,联合优化预测的准确性和相对姿态顺序。
- 对余弦相似度输出应用反余弦变换,将结果映射为实际的欧拉角,确保预测结果具有有界性和几何意义。
- 端到端训练模型,通过对比监督学习抽象关键点——即与身份和光照无关的姿态特定特征。
实验结果
研究问题
- RQ1通过余弦和反余弦运算将头部姿态预测转换到有界角度空间,是否能提升回归精度?
- RQ2一种比较同一人图像对的排序损失,是否能增强模型对光照和身份等姿态无关变化的泛化能力?
- RQ3反余弦变换与排序损失的结合是否能带来更好的局部特征学习效果,从而提升姿态估计性能?
- RQ4所提出的方法在AFLW2000和BIWI等标准基准测试上,相较于现有最先进方法,性能提升程度如何?
主要发现
- RankPose 将 AFLW2000 数据集上的平均 MAE 从 SOTA 的 4.50 降低至 3.66,相对提升 18.66%。
- 在 BIWI 数据集上,RankPose 将 MAE 从 SOTA 的 4.00 降低至 3.71,相对减少 7.25%。
- 误差分布显示,98.7% 的偏航角预测误差在 ±15° 以内,97.25% 的俯仰角误差在 ±20° 以内,97.15% 的翻滚角误差在 ±20° 以内,表明模型具有强鲁棒性。
- 消融实验表明,结合 MSE 的排序损失始终优于仅使用 MSE 的方法,且反余弦变换能获得最佳性能。
- 该模型在所有角度(偏航、俯仰、翻滚)上均表现优异,相较于基于关键点和无关键点的 SOTA 方法均有稳定提升。
- 该方法展现出强大的泛化能力,尤其在身份和光照变化较大的复杂条件下表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。