Skip to main content
QUICK REVIEW

[论文解读] Dense Human Body Correspondences Using Convolutional Networks

Lingyu Wei, Qixing Huang|arXiv (Cornell University)|Nov 18, 2015
3D Shape Modeling and Analysis参考文献 46被引用 13
一句话总结

本文提出一种基于改进卷积神经网络的深度学习方法,可在无需完整封闭几何结构、一致视角或全身扫描的情况下,实现从部分深度图或部分表面中实时计算3D人体扫描之间的密集对应关系。通过训练网络在边界附近实现平滑的特征嵌入以进行体部区域分类,该方法在复杂姿态下的着装与裸体人体上均实现了最先进水平的准确性,优于现有无监督及非刚性配准方法。

ABSTRACT

We propose a deep learning approach for finding dense correspondences between 3D scans of people. Our method requires only partial geometric information in the form of two depth maps or partial reconstructed surfaces, works for humans in arbitrary poses and wearing any clothing, does not require the two people to be scanned from similar viewpoints, and runs in real time. We use a deep convolutional neural network to train a feature descriptor on depth map pixels, but crucially, rather than training the network to solve the shape correspondence problem directly, we train it to solve a body region classification problem, modified to increase the smoothness of the learned descriptors near region boundaries. This approach ensures that nearby points on the human body are nearby in feature space, and vice versa, rendering the feature descriptor suitable for computing dense correspondences between the scans. We validate our method on real and synthetic data for both clothed and unclothed humans, and show that our correspondences are more robust than is possible with state-of-the-art unsupervised methods, and more accurate than those found using methods that require full watertight 3D geometry.

研究动机与目标

  • 在任意姿态和着装条件下,实现对3D人体扫描之间密集、实时的对应关系计算,即使输入为部分或不完整数据(如深度图)亦可。
  • 克服现有无监督方法在大形变、遮挡或因衣物导致的拓扑变化下失效的局限性。
  • 减少对完整、封闭3D几何结构的依赖,此类结构在使用RGB-D传感器的真实扫描场景中往往不可用。
  • 开发一个统一的学习框架,整合SCAPE数据集中的标准姿态数据与Yobi3D和MIT数据集中的着装人体数据,以实现鲁棒的泛化能力。
  • 在降低训练数据需求的同时,通过在体部区域边界附近提升特征描述子的平滑性,减少对应匹配中的异常值。

提出的方法

  • 训练一种基于改进AlexNet的深度卷积神经网络,从深度图像素预测体部区域分类,重点提升边界附近的特征平滑性。
  • 采用多段分割技术生成3D表面的重复测地线分割,引导网络在特征空间中学习更平滑的嵌入。
  • 在SCAPE数据库(裸体受试者)与Yobi3D及MIT数据集(着装受试者)的3D扫描组合数据集上端到端训练网络,使用顶点级标签。
  • 通过从多个视角渲染深度图,并对训练后网络输出的像素级特征进行平均,提取顶点级特征描述子。
  • 通过在学习到的特征空间中进行最近邻搜索计算密集对应关系,随后使用现成的非刚性配准算法进行优化。
  • 该方法可适用于完整3D模型、部分扫描或单张深度图,支持实时性能,并在多种输入类型下保持鲁棒性。

实验结果

研究问题

  • RQ1深度学习模型能否学习到在大形变和衣物变化下仍保持一致的平滑、可区分的3D人体扫描特征描述子?
  • RQ2如何训练神经网络,使其生成的特征嵌入能保留表面局部几何邻近性,即使在体部区域边界附近亦可?
  • RQ3统一的网络架构在裸体与着装人体受试者、不同姿态及部分输入数据上,其泛化能力在多大程度上成立?
  • RQ4所提方法能否在无需完整、封闭3D几何结构或对齐初始姿态的情况下,实现高精度的密集对应关系?
  • RQ5在训练过程中使用重复网格分割是否能显著减少所需训练样本数量,同时提升对应关系的鲁棒性?

主要发现

  • 在FAUST数据集上,该方法在受试者内配对中的平均误差为2.00 cm,在受试者间配对中为2.35 cm,优于所有先前的无监督方法,并与Chen等人[10]的最先进非刚性配准方法持平。
  • 经非刚性优化后(CNN-S),该方法在受试者内配对中的10 cm召回率达到0.975,在受试者间配对中为0.972,显著优于RF(0.658)和BIM(0.615)等方法。
  • 该方法每对扫描的密集对应关系计算时间少于1秒,展现出实时性能,而现有非刚性配准技术则慢得多。
  • 基于多段分割的训练方法显著减少了体部区域边界附近的特征空间异常值,相比标准分类网络提升了鲁棒性。
  • 该方法在部分对部分和部分对完整形状匹配中均表现出良好泛化能力,即使仅一个输入为完整模型,也能实现精确对应。
  • 得益于基于重复测地线分割的平滑性诱导训练目标,该方法相比传统方法显著减少了训练数据需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。