Skip to main content
QUICK REVIEW

[论文解读] Vid2Game: Controllable Characters Extracted from Real-World Videos

Oran Gafni, Lior Wolf|arXiv (Cornell University)|Apr 17, 2019
Human Pose and Action Recognition参考文献 38被引用 10
一句话总结

该论文提出Vid2Game,一种从真实世界视频中提取可控制、逼真的角色并利用2D控制信号(如操纵杆输入)重新生成动画的方法。该方法使用两个新型深度神经网络——用于自回归姿态生成的Pose2Pose(P2P)和用于高保真图像合成与任意背景替换的Pose2Frame(P2F),实现了具有准确运动与外观建模、无伪影的逼真视频序列。

ABSTRACT

We are given a video of a person performing a certain activity, from which we extract a controllable model. The model generates novel image sequences of that person, according to arbitrary user-defined control signals, typically marking the displacement of the moving body. The generated video can have an arbitrary background, and effectively capture both the dynamics and appearance of the person. The method is based on two networks. The first network maps a current pose, and a single-instance control signal to the next pose. The second network maps the current pose, the new pose, and a given background, to an output frame. Both networks include multiple novelties that enable high-quality performance. This is demonstrated on multiple characters extracted from various videos of dancers and athletes.

研究动机与目标

  • 实现从非受控的真实世界视频中提取可控制、逼真的真人角色,用于动态虚拟环境。
  • 根据用户定义的2D控制信号(如操纵杆轨迹)生成长时间、连贯的视频序列,展现提取角色的运动。
  • 在保留逼真融合与阴影效果的同时,实现原始背景与任意用户指定背景(包括动态背景)的无缝替换。
  • 解决背景分离、姿态泛化能力超越训练分布范围以及自回归生成中的时间漂移等挑战。

提出的方法

  • 使用Pose2Pose(P2P)网络,基于2D控制信号(如质心轨迹)和当前姿态,以自回归方式生成全身姿态序列。
  • 采用Pose2Frame(P2F)网络,从生成的姿态、背景图像和前景掩码中合成高分辨率、逼真的视频帧。
  • 以pix2pixHD框架作为两个网络的主干,但通过新增组件进行增强:用于改进姿态控制的条件模块、用于手持物体的物体通道融合,以及基于特征匹配的判别器损失。
  • 利用DensePose实现一致的2D身体姿态表示,并通过语义分割提取手持物体,以实现精确的外观建模。
  • 在推理过程中应用“教师强制”策略,以稳定姿态预测并减少时间漂移。
  • 提出一种背景替换流程,利用预测的掩码和阴影融合技术,实现无伪影的真实感合成。

实验结果

研究问题

  • RQ1深度学习模型能否仅通过低维2D控制信号,从非受控视频中提取可控制、逼真的角色并实现重新动画?
  • RQ2模型如何在保留运动动力学与外观保真度的同时,生成具有任意背景替换能力的真实视频序列?
  • RQ3该模型在训练分布范围外的新姿态和控制信号上的泛化能力如何?
  • RQ4与现有视频到视频转换模型相比,该方法在图像质量、背景处理和时间连贯性方面表现如何?

主要发现

  • Pose2Frame网络在感知质量上优于基线方法(如pix2pixHD和vid2vid),LPIPS分数更低(如网球测试集上0.28 vs. 0.35),SSIM值更高。
  • P2F网络显著减少了背景伪影和角色形变,尤其在具有动态背景的复杂场景中表现更优,优于建模整个场景的方法。
  • 消融实验证实,所提出的条件模块和物体通道融合显著提升了姿态生成质量,相比传统基线,LPIPS降低12%。
  • 该方法保持了角色比例的一致性,避免了向驱动姿态方向发生明显缩放与形变,而vid2vid基线则表现出明显的缩放与扭曲。
  • 尽管未使用时间平滑损失,生成的视频在时间连贯性上与最先进方法相当,表明其具备稳健的内部运动建模能力。
  • 系统成功生成了长时间、连贯的视频序列,即使在高度动态或复杂的背景下,也能实现阴影与运动效果的真实融合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。