[论文解读] Vid2Actor: Free-viewpoint Animatable Person Synthesis from Video in the Wild
Vid2Actor 提出了一种自监督深度学习方法,能够从单个未经结构化的野外人物视频中重建出自由视角、可动画化的三维人体体素。通过学习一个规范化的 RGBα 体素和与姿态相关的运动权重,该方法在无需三维监督的情况下实现了高质量的新姿态和新视角合成,成功实现了在多样化真实视频上的动作重定向与子弹时间渲染,且伪影极少。
Given an "in-the-wild" video of a person, we reconstruct an animatable model of the person in the video. The output model can be rendered in any body pose to any camera view, via the learned controls, without explicit 3D mesh reconstruction. At the core of our method is a volumetric 3D human representation reconstructed with a deep network trained on input video, enabling novel pose/view synthesis. Our method is an advance over GAN-based image-to-image translation since it allows image synthesis for any pose and camera via the internal 3D representation, while at the same time it does not require a pre-rigged model or ground truth meshes for training, as in mesh-based learning. Experiments validate the design choices and yield results on synthetic data and on real videos of diverse people performing unconstrained activities (e.g. dancing or playing tennis). Finally, we demonstrate motion re-targeting and bullet-time rendering with the learned models.
研究动机与目标
- 在无需三维监督或预设绑定模型的情况下,实现从非约束、野外场景视频中生成可动画化、自由视角的三维人体合成。
- 解决从单个视频中利用有限、多样且未校准的数据合成新姿态和新视角的挑战。
- 开发一种自监督框架,仅使用图像观测即可在多样化身体姿态和相机视角间实现泛化。
- 展示如动作重定向和子弹时间渲染等实际应用,利用学习到的三维表示实现。
提出的方法
- 该方法将人物表示为学习得到的规范 RGBα 体素以及一组与姿态相关的体素运动权重,从而实现对新姿态和新视角的重投影。
- 使用 L1、感知和对抗性损失的组合,端到端训练深度神经网络以预测规范体素和运动权重。
- 该框架利用体素形变技术,从低分辨率输入重建出高分辨率三维几何,借鉴了先前基于体素的 NVS 方法的思想。
- 模型仅使用视频帧进行自监督训练,避免了对真实三维网格、SMPL 参数或多视角校准的依赖。
- 通过将学习到的运动权重应用于规范体素,实现对身体姿态和相机角度的显式控制。
- 系统使用三维人体姿态估计作为输入,实现动作重定向与子弹时间渲染,通过围绕主体旋转相机路径完成。
实验结果
研究问题
- RQ1能否从单个未经结构化的视频中,无需三维监督或预设绑定模型,学习到三维人体表示?
- RQ2自监督网络在未见的新姿态和新视角上的泛化能力如何?
- RQ3学习到的体素表示是否能在无需显式三维重建的情况下,支持高质量的动作重定向与子弹时间渲染?
- RQ4在从非约束视频中实现自由视角合成时,哪种损失函数最有效地保留外观和细节?
- RQ5输入视频中姿态和视角的多样性如何影响重建三维模型的质量?
主要发现
- 该方法在多样化的真实世界视频上实现了高质量的新视角与新姿态合成,包括跳舞和打网球等序列,即使输入仅300帧也表现良好。
- 感知损失显著提升了渲染质量,尤其在面部和身体细节方面,定性消融研究已证实此效果。
- 通过将动捕数据应用于学习到的模型,动作重定向可有效实现,从而在任意姿态下生成逼真动画。
- 通过利用预测的三维姿态旋转相机路径,成功实现了子弹时间渲染,其表现优于 PIFu 和 PIFuHD,尤其在非正前方和复杂姿态下。
- 模型对未见配置具有良好的泛化能力,随着输入视频长度和姿态多样性的提升,结果持续改善。
- 尽管在处理姿态相关的外观变化和高光效应方面存在局限,但重建结果在广泛视角和姿态下依然合理且视觉上令人信服。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。