[论文解读] DwNet: Dense warp-based network for pose-guided human video generation
DwNet 提出了一种基于 GAN 的视频生成框架,用于基于姿态引导的人体动作迁移,采用密集变形校正与循环时间条件建模。通过利用详细的密集姿态表征,并基于先前输出进行迭代帧生成,该方法在 Fashion 和 TaiChi 数据集上实现了最先进的逼真度、时间一致性和外观保真度表现。
Generation of realistic high-resolution videos of human subjects is a challenging and important task in computer vision. In this paper, we focus on human motion transfer - generation of a video depicting a particular subject, observed in a single image, performing a series of motions exemplified by an auxiliary (driving) video. Our GAN-based architecture, DwNet, leverages dense intermediate pose-guided representation and refinement process to warp the required subject appearance, in the form of the texture, from a source image into a desired pose. Temporal consistency is maintained by further conditioning the decoding process within a GAN on the previously generated frame. In this way a video is generated in an iterative and recurrent fashion. We illustrate the efficacy of our approach by showing state-of-the-art quantitative and qualitative performance on two benchmark datasets: TaiChi and Fashion Modeling. The latter is collected by us and will be made publicly available to the community.
研究动机与目标
- 解决从单张源图像和驱动动作视频生成高分辨率、时间一致的人体视频的挑战。
- 通过使用密集中间表征而非稀疏关键点或骨骼基方法,提升外观保留效果并减少姿态引导视频生成中的视觉伪影。
- 通过将每一帧的生成条件依赖于先前生成的帧,提升时间一致性,避免独立逐帧生成。
- 开发一种精细化的变形网格估计模块,以校正基于密集姿态的变形中的误差,提升纹理对齐度与真实感。
- 收集并发布一个新的高分辨率时尚视频数据集,以支持未来在人体动作迁移领域的研究。
提出的方法
- 利用从 DensePose 衍生的密集中间表征,引导源主体外观精确映射至目标姿态。
- 引入两阶段变形校正机制:先进行粗略变形网格估计,再通过精细化变形网格校正姿态引起的形变。
- 采用基于 GAN 的自编码器架构,其中生成器条件依赖于源图像、目标姿态以及先前生成的帧。
- 通过将生成器条件依赖于前一帧,采用马尔可夫建模策略,确保视频序列中时间上的一致性。
- 使用感知损失、FID 和平均关键点距离(AKD)作为评估指标,以优化逼真度与对齐度。
- 采用对抗损失与感知重建损失进行端到端训练,以保留高频细节与纹理保真度。
实验结果
研究问题
- RQ1与稀疏关键点或骨骼基方法相比,基于密集变形的方法是否能显著提升姿态引导人体视频生成的视觉质量并减少伪影?
- RQ2将帧生成条件依赖于前一帧是否能显著提升视频生成的时间一致性?
- RQ3精细化的变形网格估计模块在多大程度上减少了变形误差并增强了外观一致性?
- RQ4在高分辨率人体动作迁移任务中,该方法在定量与定性表现上与当前最先进方法相比如何?
- RQ5一个公开可用的新高分辨率时尚视频数据集是否能提升该领域的基准测试与可复现性?
主要发现
- 在 Fashion 数据集上,DwNet 实现了最低的感知损失(0.2811)与 FID(13.09),优于 MonkeyNet 与 Coordinate Inpainting。
- 在 TaiChi 数据集上,DwNet 实现了 0.5960 的感知损失与 75.44 的 FID,展现出在复杂运动序列上的强大性能。
- 用户偏好研究表明,在 Fashion 数据集上,DwNet 在 99.6% 的比较中更受青睐;在 TaiChi 数据集上为 85.2%,表明其具有极强的感知质量。
- 消融实验表明,若移除精细化变形网格,FID 从 13.09 上升至 15.37;若同时移除全部变形组件,则生成结果变得模糊且不一致。
- 对前一帧的马尔可夫条件建模显著提升了时间一致性,该结论通过定性与定量结果均得到验证。
- 完整模型(包含粗略与精细化变形网格)生成的结果最为逼真且一致,纹理错位与面部失真最少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。