[论文解读] Deep Textured 3D Reconstruction of Human Bodies
本论文提出了一种基于RGB和深度(RGB/D)输入的单图像3D纹理人体重建深度学习框架,结合体素形状预测与正交纹理合成。通过从多视角RGB/D数据中共同学习深度与形状,该方法在合成数据和真实世界数据上均实现了优越的重建质量,相较于仅使用RGB的基线方法,在复杂姿态和杂乱背景条件下表现更优。
Recovering textured 3D models of non-rigid human body shapes is challenging due to self-occlusions caused by complex body poses and shapes, clothing obstructions, lack of surface texture, background clutter, sparse set of cameras with non-overlapping fields of view, etc. Further, a calibration-free environment adds additional complexity to both - reconstruction and texture recovery. In this paper, we propose a deep learning based solution for textured 3D reconstruction of human body shapes from a single view RGB image. This is achieved by first recovering the volumetric grid of the non-rigid human body given a single view RGB image followed by orthographic texture view synthesis using the respective depth projection of the reconstructed (volumetric) shape and input RGB image. We propose to co-learn the depth information readily available with affordable RGBD sensors (e.g., Kinect) while showing multiple views of the same object during the training phase. We show superior reconstruction performance in terms of quantitative and qualitative results, on both, publicly available datasets (by simulating the depth channel with virtual Kinect) as well as real RGBD data collected with our calibrated multi Kinect setup.
研究动机与目标
- 解决在复杂姿态、衣物遮挡和背景杂乱等真实世界条件下,从单张RGB图像重建详细纹理3D人体模型的挑战。
- 通过实现免标定、单视角重建,克服现有方法依赖标定多相机系统或强人体模型先验的局限性。
- 通过使用低成本传感器(如Kinect)获取的多视角RGB/D数据,在训练过程中共同学习深度与形状表征,以提升重建精度。
- 通过从预测的体素形状和输入RGB图像中合成正交纹理视图,实现在单张图像下高质量的纹理恢复。
- 通过在包括极端姿态和复杂背景在内的多样化数据集上使用模拟与真实RGBD数据,证明方法的鲁棒性。
提出的方法
- 该方法首先使用在多视角RGB/D数据上训练的深度神经网络,从单张RGB图像预测非刚性人体的体素网格表示。
- 在训练过程中利用RGB/D传感器提供的深度信息,共同学习深度与形状表征,从而对网络进行正则化并提升泛化能力。
- 通过将重建的3D体素形状投影到深度空间,并利用对应的RGB图像生成2D正交纹理图,实现正交纹理视图的合成。
- 使用变分自编码器从合成的正交视图生成低分辨率(64×64)纹理图像,随后将其投影回3D网格以生成带纹理的模型。
- 训练范式采用标定的多-Kinect系统获取的多视角数据,部分情况下通过虚拟Kinect模拟深度,以实现对单视角推理的稳健泛化。
- 该方法利用人体对称性提升重建鲁棒性,而无需施加显式的人体模型约束,从而能够部分处理自由形态衣物引起的非刚性形变。
实验结果
研究问题
- RQ1深度学习模型是否能够在不依赖标定多相机系统的情况下,实现从单张RGB图像对非刚性人体进行精确的3D重建?
- RQ2在存在自遮挡和复杂姿态的情况下,训练过程中整合深度信息在多大程度上能提升单图像3D重建性能?
- RQ3当仅有一张RGB图像时,单视角纹理合成流程在多大程度上能够生成合理的纹理?
- RQ4深度与形状表征的联合学习在多大程度上增强了模型在多样化姿态和背景条件下的鲁棒性?
- RQ5该方法是否能够在保持高重建质量的前提下,泛化到使用标定多-Kinect系统采集的真实世界RGBD数据?
主要发现
- 所提方法在多个数据集上实现了显著优于仅使用RGB的基线方法的定量性能,特别是在复杂姿态和杂乱背景条件下,交并比(IoU)表现更优。
- 在具有挑战性的场景下(如MIT的倒立姿势序列和复杂背景),RGB与RGB/D输入之间的IoU差异进一步扩大,凸显了深度信息在实现精确重建中的关键作用。
- 定性结果表明,由于网络能够有效利用人体对称性,因此在各种人体动作(包括极端姿态)下均表现出鲁棒的重建能力。
- 在Samba舞蹈序列的结果中,该方法成功处理了非刚性形变(如自由形态衣物引起的形变),且未施加显式的人体模型约束。
- 纹理合成生成了合理、低分辨率(64×64)的正交纹理,并有效投影到3D网格上,结果已在补充视频中展示。
- 该框架在使用标定多-Kinect系统采集的真实世界RGBD数据上表现出强大的泛化能力,证实了其在真实场景中的实际应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。