Skip to main content
QUICK REVIEW

[论文解读] What Face and Body Shapes Can Tell About Height

Semih Günel, Helge Rhodin|arXiv (Cornell University)|May 25, 2018
Face recognition and analysis参考文献 36被引用 8
一句话总结

本文提出一种深度学习方法,仅通过单张RGB图像估算人体身高,无需校准相机或已知的场景几何信息。通过利用来自面部和身体特征的尺度不变解剖比例,并在新整理的274,964张图像数据集上进行训练,该方法实现了5.56厘米的平均绝对误差(MAE),显著优于以往在未校准设置下的工作。

ABSTRACT

Recovering a person's height from a single image is important for virtual garment fitting, autonomous driving and surveillance, however, it is also very challenging due to the absence of absolute scale information. We tackle the rarely addressed case, where camera parameters and scene geometry is unknown. To nevertheless resolve the inherent scale ambiguity, we infer height from statistics that are intrinsic to human anatomy and can be estimated from images directly, such as articulated pose, bone length proportions, and facial features. Our contribution is twofold. First, we experiment with different machine learning models to capture the relation between image content and human height. Second, we show that performance is predominantly limited by dataset size and create a new dataset that is three magnitudes larger, by mining explicit height labels and propagating them to additional images through face recognition and assignment consistency. Our evaluation shows that monocular height estimation is possible with a MAE of 5.56cm.

研究动机与目标

  • 解决在相机参数和场景几何未知的未校准设置下进行单目身高估计的挑战。
  • 通过利用头肩比和肢体长度比等内在解剖比例,克服单张图像身高估计中的固有尺度模糊性。
  • 开发一种可扩展的方法,通过人脸识别和一致性约束,在大规模图像集合中挖掘并传播身高标签。
  • 证明当在足够大的数据集上训练时,模型性能主要受限于数据集大小,而非网络架构选择。
  • 研究面部细节与整体身体外观在身高预测中的相对贡献,并表明多尺度特征学习可提高准确性。

提出的方法

  • 使用人脸识别和同一人物图像间标签的一致性,将少量标注图像中的显式身高标签传播到更大的图像集合中。
  • 端到端训练深度神经网络,以图像特征为输入回归身高,同时使用身体和面部区域作为输入。
  • 设计一种多流网络架构,同时捕捉特定尺度的特征——小尺度的面部细节和大尺度的身体比例。
  • 使用身体裁剪图、面部裁剪图以及身体+面部联合输入的组合,评估特征贡献并优化输入模态。
  • 应用数据增强和归一化技术,提高对姿态、光照和视角变化的鲁棒性。
  • 在两个数据集上训练和评估模型:IMDB-100K(含10万张图像)和较小的Lab-test数据集,并通过消融研究隔离性能提升来源。

实验结果

研究问题

  • RQ1能否从单张图像可靠估计解剖比例(如头肩比和肢体长度比),并在无相机校准的情况下用于推断绝对身高?
  • RQ2训练数据集的大小如何影响深度学习模型在单目身高估计中的性能?
  • RQ3与整体身体外观相比,面部特征在身高估计中的贡献程度如何?多尺度特征学习是否具有优势?
  • RQ4能否通过人脸识别和一致性约束,在大规模图像集合中自动传播可靠的身高标签?
  • RQ5当在大规模数据集上训练时,深度学习架构的选择是否显著影响性能?

主要发现

  • 所提方法在IMDB-100K数据集上实现了5.56厘米的平均绝对误差(MAE),显著优于以往的最先进方法。
  • 性能随数据集增大而显著提升,表明当前性能限制源于数据稀缺,而非模型容量。
  • 面部和整体身体特征的结合取得最佳性能,且在Lab-test数据集上,仅使用面部输入的表现优于仅使用身体输入,可能由于面部姿态变化更大。
  • 先分别处理面部和身体特征再进行融合的多尺度深度网络取得更优结果,证实捕捉小尺度面部细节的重要性。
  • 性别特定训练可提升性能,尤其对女性更为显著,表明性别感知建模可增强回归准确性。
  • 消融研究证实,DeepNet优于简单模型(Linear、ShallowNet),且包含联合身体+面部输入的完整模型在IMDB-100K数据集上达到最低误差(6.06厘米)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。