[论文解读] TEMOS: Generating diverse human motions from textual descriptions
TEMOS 提出了一种基于变分自编码器的文本到动作生成模型,采用联合跨模态 Transformer 架构,从自然语言描述中生成多样化的 3D 人体动作序列。通过从基于文本条件的已学习潜在空间中采样,该模型可为每个描述生成多个合理动作,其在 KIT Motion-Language 基准测试中达到最先进性能,定量指标与人类感知评估均取得显著提升。
We address the problem of generating diverse 3D human motions from textual descriptions. This challenging task requires joint modeling of both modalities: understanding and extracting useful human-centric information from the text, and then generating plausible and realistic sequences of human poses. In contrast to most previous work which focuses on generating a single, deterministic, motion from a textual description, we design a variational approach that can produce multiple diverse human motions. We propose TEMOS, a text-conditioned generative model leveraging variational autoencoder (VAE) training with human motion data, in combination with a text encoder that produces distribution parameters compatible with the VAE latent space. We show the TEMOS framework can produce both skeleton-based animations as in prior work, as well more expressive SMPL body motions. We evaluate our approach on the KIT Motion-Language benchmark and, despite being relatively straightforward, demonstrate significant improvements over the state of the art. Code and models are available on our webpage.
研究动机与目标
- 为解决从自然语言描述中生成多样且逼真的 3D 人体动作序列的挑战,此类描述通常具有模糊性并允许多重解释。
- 克服先前方法仅对每个文本输入生成单一确定性动作的局限,通过将动作建模为分布而非单一序列。
- 开发一种序列级生成模型,避免自回归解码及其随时间累积的误差与漂移。
- 使同一文本条件框架能够生成基于骨骼关节点与 SMPL 全身网格的动作。
- 不仅通过定量评估,还通过人类感知研究对模型进行评估,认识到标准指标在概率性动作生成中的局限性。
提出的方法
- 采用变分自编码器(VAE)框架,其中动作生成基于由文本编码器参数化的分布采样得到的潜在向量。
- 使用独立的 Transformer 编码器对文本和动作序列进行编码,将其映射到共享的跨模态潜在空间。
- 动作解码器采用带位置编码和单个潜在向量的 Transformer 架构,一次性前向传播生成完整 3D 动作序列,避免自回归生成。
- 模型在 KIT Motion-Language 数据集上端到端训练,其中文本编码器输出 VAE 潜在分布的参数(均值与对数方差)。
- 该框架支持生成基于骨骼关节点序列与 SMPL 身体网格序列,实现更富表现力的动作合成。
- 在多种设置下对模型进行评估,包括从零开始生成完整动作(不依赖第一帧真实值),并开展消融实验以隔离关键架构组件。
实验结果
研究问题
- RQ1序列级、非自回归的生成模型能否从自然语言描述中生成多样且逼真的 3D 人体动作?
- RQ2基于 VAE 的方法与共享跨模态潜在空间相比自回归模型,在动作多样性与质量方面表现如何?
- RQ3使用单个潜在向量进行整序列生成相比自回归解码,性能提升程度如何?
- RQ4当模型在不依赖第一帧真实值的条件下从零开始生成完整动作时,其表现如何?
- RQ5微调文本编码器对模型性能有何影响?冻结文本编码器是否能获得更好结果?
主要发现
- TEMOS 在 KIT Motion-Language 基准测试中达到最先进性能,优于先前工作,无论在定量指标还是人类感知评估中均表现更优。
- 该模型可为每个文本输入生成多个多样且合理的动作序列,有效探索了模糊语言描述中固有的自由度。
- 消融实验证明,相较于先前方法,其主要改进源于使用单个潜在向量进行非自回归、序列级生成,而非自回归解码。
- 与先前方法相比,该模型显著降低了位置误差与方差误差,当语言模型被冻结时,平均位置误差为 0.963(根关节)与 0.955(全局轨迹)。
- 微调语言模型参数并未提升性能,表明对此任务而言,冻结文本编码器可获得更好的泛化能力。
- 定性结果表明,即使动作描述模糊,该模型仍能生成符合文本描述的多样化 SMPL 基全身动作,视频示例中可观察到明显的视觉多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。