Skip to main content
QUICK REVIEW

[论文解读] Pretrained Diffusion Models for Unified Human Motion Synthesis

Jianxin Ma, Shuai Bai|arXiv (Cornell University)|Dec 6, 2022
Human Pose and Action Recognition被引用 11
一句话总结

MoFusion 提出了一种统一的人体动作生成框架,采用基于 Transformer 主干的预训练扩散模型,支持零样本混合多种控制信号(例如文本和音乐),并可处理多粒度任务,如文本到动作、动作补全和逆运动学。预训练使模型能够扩展到更大规模而不会过拟合,同时可学习的骨骼适配器可处理跨数据集的骨骼差异。

ABSTRACT

Generative modeling of human motion has broad applications in computer animation, virtual reality, and robotics. Conventional approaches develop separate models for different motion synthesis tasks, and typically use a model of a small size to avoid overfitting the scarce data available in each setting. It remains an open question whether developing a single unified model is feasible, which may 1) benefit the acquirement of novel skills by combining skills learned from multiple tasks, and 2) help in increasing the model capacity without overfitting by combining multiple data sources. Unification is challenging because 1) it involves diverse control signals as well as targets of varying granularity, and 2) motion datasets may use different skeletons and default poses. In this paper, we present MoFusion, a framework for unified motion synthesis. MoFusion employs a Transformer backbone to ease the inclusion of diverse control signals via cross attention, and pretrains the backbone as a diffusion model to support multi-granularity synthesis ranging from motion completion of a body part to whole-body motion generation. It uses a learnable adapter to accommodate the differences between the default skeletons used by the pretraining and the fine-tuning data. Empirical results show that pretraining is vital for scaling the model size without overfitting, and demonstrate MoFusion's potential in various tasks, e.g., text-to-motion, motion completion, and zero-shot mixing of multiple control signals. Project page: \url{https://ofa-sys.github.io/MoFusion/}.

研究动机与目标

  • 将多种人体动作生成任务(如文本到动作、动作补全和逆运动学)统一到一个可扩展的模型中。
  • 通过在多个数据集上进行大规模预训练,克服动作建模中的数据稀缺和过拟合问题。
  • 通过组合控制信号(如文本和音乐)实现在无联合监督下的零样本技能组合。
  • 通过可学习的骨骼适配器处理动作数据集中的差异,包括不同的骨骼结构和默认姿态。
  • 证明通过在多样化动作数据上进行多任务预训练,可有效训练大规模模型而不会过拟合。

提出的方法

  • MoFusion 采用基于 Transformer 的扩散模型,利用交叉注意力机制,根据多种控制信号(如文本、音乐或关节位置)进行生成条件控制。
  • 模型在大规模动作数据语料上进行预训练,采用扩散损失的 x₀-预测变体,并通过启发式方法将数据重定向到类似 SMPL-H 的骨骼结构。
  • 引入可学习的骨骼适配器,以对齐关节表征并补偿预训练和微调数据之间在默认姿态上的差异。
  • 该框架支持多粒度生成:通过完整去噪实现全身动作生成,通过掩码去噪实现对特定身体部位的部分编辑。
  • 采用交替控制策略,在去噪过程中迭代关注不同编码器,实现多种控制信号的零样本混合。
  • 应用后处理技术,包括增量内补全损失和微调目标,以减少动作插值任务中的不连续性。

实验结果

研究问题

  • RQ1单一统一模型能否有效处理具有不同控制信号和目标粒度的多样化动作生成任务?
  • RQ2在多样化动作数据上进行多任务预训练是否能实现零样本泛化,例如在无联合监督下组合文本和音乐控制?
  • RQ3即使每个任务的数据有限,大规模动作模型是否仍能通过有效预训练避免过拟合?
  • RQ4可学习的骨骼适配器在处理跨数据集骨骼差异方面是否显著优于手动重定向或简单 MLP?
  • RQ5预训练在多大程度上支持模型规模的扩展,同时在下游任务中保持性能?

主要发现

  • 预训练使模型规模得以有效扩展——例如,2.5 亿参数的模型在无预训练的情况下表现优于更小的模型,表明大规模预训练可有效缓解过拟合。
  • 所提出的骨骼适配器性能与手动重定向相当,且显著优于简单 MLP 基线,后者在无预训练时无法泛化。
  • MoFusion 能够成功生成文本和音乐控制信号的零样本混合动作,其中超参数 γ 有效控制了信号之间的平衡。
  • 增量内补全损失和微调目标显著减少了动作插值任务中的不连续性,优于标准 RePaint 和基线方法。
  • 实证结果表明,MoFusion 在各类任务中均表现出良好的泛化能力,包括文本到动作、动作补全和逆运动学,且性能持续提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。