Skip to main content
QUICK REVIEW

[论文解读] A Pixel-Based Framework for Data-Driven Clothing

Ning Jin, Yilin Zhu|arXiv (Cornell University)|Dec 3, 2018
3D Shape Modeling and Analysis参考文献 57被引用 20
一句话总结

该论文提出了一种基于像素的深度学习框架,将3D衣物形变建模为图案空间中的一系列2D RGB图像,使CNN能够从姿态参数中学习逼真的衣物动态。通过将衣物顶点嵌入为图像像素,并使用卷积网络预测纹理和位移偏移,该方法实现了高保真度、可扩展的虚拟衣物,对蒙皮误差具有鲁棒性,且无需精确的赤身身体形状。

ABSTRACT

With the aim of creating virtual cloth deformations more similar to real world clothing, we propose a new computational framework that recasts three dimensional cloth deformation as an RGB image in a two dimensional pattern space. Then a three dimensional animation of cloth is equivalent to a sequence of two dimensional RGB images, which in turn are driven/choreographed via animation parameters such as joint angles. This allows us to leverage popular CNNs to learn cloth deformations in image space. The two dimensional cloth pixels are extended into the real world via standard body skinning techniques, after which the RGB values are interpreted as texture offsets and displacement maps. Notably, we illustrate that our approach does not require accurate unclothed body shapes or robust skinning techniques. Additionally, we discuss how standard image based techniques such as image partitioning for higher resolution, GANs for merging partitioned image regions back together, etc., can readily be incorporated into our framework.

研究动机与目标

  • 开发一种可扩展、数据驱动的框架,用于实现逼真的虚拟衣物,避免对精确的赤身身体形状或复杂物理模拟的依赖。
  • 通过在图案空间中将3D衣物表示为2D RGB图像序列,利用卷积神经网络实现高保真度的衣物形变预测。
  • 通过从姿态驱动的图像序列学习,而非依赖精确的骨骼形变,提高对蒙皮伪影(如糖果纸扭曲)的鲁棒性。
  • 通过利用基于图像的深度学习技术并保持最低计算开销,支持高效、实时的虚拟试穿应用。
  • 通过自适应网络架构和损失函数,在包括高对比度、细长衣物(如领结)在内的多种衣物类型上实现泛化能力。

提出的方法

  • 将衣物几何结构映射到2D图案空间,其中每个顶点以RGB值表示像素,编码其在纹理和法线坐标上相对于身体表面的位移。
  • 衣物像素以重心方式嵌入身体网格,并在动画过程中随身体移动,保持其在2D图案空间中的位置。
  • 训练卷积神经网络(CNN)从关节角度参数预测RGB图像序列,从而学习衣物形变的“编排”过程。
  • 预测后,RGB值被解释为纹理偏移和位移图,并使用标准蒙皮技术重新投影到3D世界空间。
  • 该框架整合了基于图像的技术,如图像分割、用于区域合并的GAN,以及多尺度损失函数(L1、L2、法线和边长),以提高重建质量。
  • 对于复杂衣物(如领结),网络被调整为预测具有1:4长宽比的矩形图像,并引入专用的边长损失以保持结构完整性。

实验结果

研究问题

  • RQ13D衣物形变能否被有效建模为图案空间中的一系列2D RGB图像,从而实现利用强大CNN进行学习?
  • RQ2该框架对赤身身体形状不准确和蒙皮伪影(如糖果纸扭曲)的鲁棒性如何?
  • RQ3该方法能否在无需大幅架构修改的情况下,泛化到包括细长、高对比度衣物(如领结)在内的多种衣物类型?
  • RQ4哪些损失函数和网络架构能在重建精度与计算效率之间实现最佳权衡?
  • RQ5基于图像的技术(如GAN和图像分割)在多大程度上可被整合到框架中,以提升分辨率和视觉质量?

主要发现

  • 当使用L1损失结合法线损失时,CNN框架在测试集上实现了每顶点平均位置误差0.44厘米,法线向量误差为0.027余弦距离。
  • 引入法线向量损失(权重0.01)后,法线误差从0.027增加到0.029,表明表面朝向的一致性得到改善。
  • 对于领结,模型采用216万参数的网络,输出分辨率为64×256,并使用L1与边长损失的组合(权重0.1)以保持结构平滑性。
  • 在根关节坐标系中使用PCA嵌入的偏移进行训练,将泛化误差降低至0.55厘米(相比直接预测的0.67厘米),表明泛化能力提升。
  • 全连接网络中使用ReLU激活函数可实现更快收敛,且性能与Tanh相当,同时在训练速度和稳定性方面优于先前方法。
  • 该方法对错误的赤身身体形状表现出鲁棒性,在引入蒙皮伪影的情况下仍能保持视觉质量与低误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。