[论文解读] Dense Pose Transfer
本文提出Dense Pose Transfer,一种神经合成框架,利用密集人体表面表征将源图像中人物的外观转移到由姿态提供者引导的新姿态上。通过结合基于表面的形变模块、修复网络以及端到端训练的条件生成模型(采用对抗性、感知和重建损失),该方法在DeepFashion和MVC数据集上的姿态迁移任务中取得了最先进性能,优于基于关键点和掩码的基线方法。
In this work we integrate ideas from surface-based modeling with neural synthesis: we propose a combination of surface-based pose estimation and deep generative models that allows us to perform accurate pose transfer, i.e. synthesize a new image of a person based on a single image of that person and the image of a pose donor. We use a dense pose estimation system that maps pixels from both images to a common surface-based coordinate system, allowing the two images to be brought in correspondence with each other. We inpaint and refine the source image intensities in the surface coordinate system, prior to warping them onto the target pose. These predictions are fused with those of a convolutional predictive module through a neural synthesis module allowing for training the whole pipeline jointly end-to-end, optimizing a combination of adversarial and perceptual losses. We show that dense pose estimation is a substantially more powerful conditioning input than landmark-, or mask-based alternatives, and report systematic improvements over state of the art generators on DeepFashion and MVC datasets.
研究动机与目标
- 通过用密集人体表面表征替代稀疏或粗糙的条件信号,提升姿态迁移的质量。
- 仅使用单张源图像和姿态提供者图像,实现人物在新姿态下的逼真图像合成。
- 开发一个端到端可训练的框架,联合优化几何感知形变、修复和生成合成。
- 证明密集姿态估计相比关键点或分割图提供了更强大的条件信号。
提出的方法
- 该方法使用DensePose将源图像和目标图像均映射到统一的三维表面基UV坐标系中,实现在不同姿态下的像素级对应。
- 在UV空间中采用U-Net结构的修复网络,对形变前的缺失或遮挡纹理进行重建。
- 通过一个独立的前馈预测模块,基于姿态和外观特征生成粗略图像合成结果。
- 通过一个融合网络将形变(基于修复)模块和预测模块的输出进行融合,损失函数结合对抗性、感知和L1重建损失进行训练。
- 整个流程通过复合损失函数端到端训练,包含L1、感知、风格和基于GAN的损失,以提升真实感与结构保真度。
- 该框架结合SMPL人体建模与DensePose,确保几何一致性,并实现姿态间准确的纹理传递。
实验结果
研究问题
- RQ1与稀疏或粗糙监督相比,密集人体表面表征是否能显著提升基于图像的姿态迁移质量与可控性?
- RQ2在UV空间中引入修复机制如何提升姿态迁移的真实感并减少伪影?
- RQ3不同损失组件(L1、感知、风格和对抗性)对最终图像质量的相对贡献如何?
- RQ4结合几何驱动形变与数据驱动合成的双流架构是否优于单流生成模型在姿态迁移任务中的表现?
- RQ5所提方法是否能在多样化数据集上泛化,并在无需显式3D监督或纹理图的情况下实现最先进性能?
主要发现
- 在DeepFashion数据集上,包含所有损失组件(L1、感知、风格和GAN)的完整模型取得了3.61的Fréchet Inception Distance(FID)分数,表明其具有优越的感知质量。
- 消融实验表明,将修复模块加入形变流后,SSIM从0.789提升至0.796,MS-SSIM从0.814提升至0.823,证明其在处理遮挡方面的有效性。
- 感知损失与结构保真度相关性最强,而风格损失虽提升了纹理锐度,但在均匀区域引入了伪影。
- 在定量指标(SSIM、MS-SSIM、IS)和定性结果上,该模型均优于基于关键点和分割的基线方法,尤其在处理复杂体型和衣物细节方面表现更优。
- 融合模块有效结合了预测流与形变流的互补优势,在纹理边界处显著减少了可见伪影。
- 该框架在DeepFashion和MVC两个数据集上均实现了最先进性能,证实了密集姿态估计作为条件信号的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。