[论文解读] NeMF: Neural Motion Fields for Kinematic Animation
NeMF 通过将运动建模为时间与风格的可微函数,引入了一种用于运动学动画的连续、隐式神经表示,采用基于变分自编码器(VAE)的架构来学习生成式运动先验。该方法无需针对特定任务进行微调,即可实现高质量、多样化的运动合成与编辑,适用于插值、补帧和重导航等任务。
We present an implicit neural representation to learn the spatio-temporal space of kinematic motions. Unlike previous work that represents motion as discrete sequential samples, we propose to express the vast motion space as a continuous function over time, hence the name Neural Motion Fields (NeMF). Specifically, we use a neural network to learn this function for miscellaneous sets of motions, which is designed to be a generative model conditioned on a temporal coordinate $t$ and a random vector $z$ for controlling the style. The model is then trained as a Variational Autoencoder (VAE) with motion encoders to sample the latent space. We train our model with a diverse human motion dataset and quadruped dataset to prove its versatility, and finally deploy it as a generic motion prior to solve task-agnostic problems and show its superiority in different motion generation and editing applications, such as motion interpolation, in-betweening, and re-navigating. More details can be found on our project page: https://cs.yale.edu/homes/che/projects/nemf/.
研究动机与目标
- 解决自回归运动模型因序列依赖性而无法直接推断未来或中间帧的局限性。
- 开发一种连续、隐式的神经表示,将运动参数化为时间与风格的函数,实现任意帧的采样。
- 通过变分自编码器(VAE)训练生成式运动先验,从大规模运动数据集中捕捉多样化运动风格。
- 展示所学习运动先验在任务无关的运动编辑与生成任务(如插值、补帧、重导航)中的实用性。
- 建立一种通用、可复用的运动先验,在无需微调的情况下,其在离线编辑应用中优于特定任务的模型。
提出的方法
- 将运动表示为连续函数 f(t; z),其中 t 为时间,z 为学习到的潜在风格码,采用多层感知机(MLP)解码器。
- 将模型训练为变分自编码器(VAE):通过卷积编码器将运动序列编码为潜在向量 z,再通过解码器重建完整运动序列。
- 在时间坐标 t 和潜在风格向量 z 上联合条件化生成模型,以实现在任意时间步长采样多样化运动风格。
- 通过预测与真实运动序列之间的重建损失优化 VAE,实现在人体与四足动物运动数据集上的端到端训练。
- 通过在 z 上求解优化问题,将训练好的 NeMF 作为下游任务的运动先验来部署,以生成期望的运动序列。
- 将运动编辑任务(如插值、补帧、重导航)形式化为潜在码优化问题,通过最小化能量函数以恢复合理运动。
实验结果
研究问题
- RQ1与离散的自回归方法相比,连续、隐式的神经表示是否能更有效地建模运动的完整时空空间?
- RQ2基于 VAE 的架构能否学习到解耦的运动先验,从而在不同风格与时间点实现多样化且高保真的运动生成?
- RQ3由 NeMF 衍生的单一、任务无关的运动先验是否能在插值与补帧等运动编辑任务中优于特定任务的模型?
- RQ4NeMF 在未见运动风格及复杂编辑场景(如沿新轨迹重导航运动)中的泛化能力如何?
- RQ5在稀疏关键帧补帧任务中,NeMF 与现有运动先验(如 HM-VAE 和 SLERP)在定量与定性表现上相比如何?
主要发现
- 在人体与四足动物运动数据集上,NeMF 在运动质量与多样性方面均优于当前最先进神经运动先验(包括 HM-VAE)。
- 在 20 帧间隔的稀疏关键帧补帧任务中,NeMF 在 FID 分数上优于 SLERP 与 HM-VAE,并生成了更自然、高频的运动细节。
- 在运动插值任务中,NeMF 能生成平滑、合理的运动片段过渡,定性结果表明其时间一致性显著提升。
- 在运动重导航任务中,NeMF 可成功将参考行走动作沿直线与正弦路径重新引导,同时保持原始运动风格与自然朝向。
- NeMF 能够在真实 AIST++ 舞蹈视频片段之间生成合理的 1 秒过渡,展现出对真实世界运动数据的强大泛化能力。
- 尽管采用任务无关的训练方式,NeMF 在编辑任务中的表现与特定任务模型相当或更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。