Skip to main content
QUICK REVIEW

[论文解读] OmniControl: Control Any Joint at Any Time for Human Motion Generation

Yiming Xie, Varun Jampani|arXiv (Cornell University)|Oct 12, 2023
Human Pose and Action Recognition被引用 5
一句话总结

OmniControl 是一种基于扩散模型的文本条件化人体动作生成模型,通过新颖的空间与真实感引导机制,实现了对任意时刻任意关节的精确空间控制。该模型在 HumanML3D 和 KIT-ML 数据集上实现了最先进性能,在控制精度与动作真实感方面显著优于先前方法,无论是在骨盆控制还是多关节控制场景下,均仅使用单一统一模型实现卓越表现。

ABSTRACT

We present a novel approach named OmniControl for incorporating flexible spatial control signals into a text-conditioned human motion generation model based on the diffusion process. Unlike previous methods that can only control the pelvis trajectory, OmniControl can incorporate flexible spatial control signals over different joints at different times with only one model. Specifically, we propose analytic spatial guidance that ensures the generated motion can tightly conform to the input control signals. At the same time, realism guidance is introduced to refine all the joints to generate more coherent motion. Both the spatial and realism guidance are essential and they are highly complementary for balancing control accuracy and motion realism. By combining them, OmniControl generates motions that are realistic, coherent, and consistent with the spatial constraints. Experiments on HumanML3D and KIT-ML datasets show that OmniControl not only achieves significant improvement over state-of-the-art methods on pelvis control but also shows promising results when incorporating the constraints over other joints.

研究动机与目标

  • 在文本条件化动作生成过程中,实现对任意时刻任意人体关节的灵活空间控制。
  • 克服现有基于图像修复方法中相对姿态表示的局限性,这些局限性阻碍了准确的全局空间控制。
  • 开发一个统一模型,能够同时控制多个关节,而无需为每个关节单独训练模型。
  • 在高控制精度与动作真实感之间取得平衡,避免产生不自然或漂移的动作。

提出的方法

  • 提出分析性空间引导,将生成的动作转换为全局坐标系,以计算与输入控制信号的梯度,实现直接且精确的优化。
  • 采用真实感引导,在扩散模型所有层的注意力特征中注入残差,以隐式方式优化全身动作。
  • 在模型输入与输出中使用相对姿态表示,以保持模型有效性,同时通过引导模块中的坐标转换实现全局控制。
  • 在空间引导中采用迭代式动态优化策略,支持可配置的迭代次数(Ke, Kl)与阈值(Ts),以平衡推理时间与精度。
  • 以互补方式结合空间引导与真实感引导:空间引导确保约束条件的满足,而真实感引导则维持动作的连贯性与物理合理性。
  • 训练单一模型以支持多关节控制,从而实现与环境及物体的复杂交互。

实验结果

研究问题

  • RQ1单一扩散模型是否能够实现在任意时刻对任意关节(包括骨盆以外的关节)的精确空间控制?
  • RQ2如何在不依赖相对位置假设的前提下,有效将空间控制信号集成到基于相对姿态的运动生成框架中?
  • RQ3结合空间引导与真实感引导对控制精度与动作真实感之间的平衡有何影响?
  • RQ4统一模型是否能有效同时控制多个关节,从而实现复杂的人员-环境交互?
  • RQ5在不同密度的空间控制信号下,模型表现如何,特别是在稀疏或密集控制场景下?

主要发现

  • 与基线方法相比,OmniControl 在密集空间信号下的骨盆控制平均误差(Avg. err.)降低了 90%。
  • 与一种计算噪声输入运动梯度的变体相比,该模型将平均误差降低了 83.8%,验证了其梯度计算策略的有效性。
  • 若不使用真实感引导,FID 上升 50%,且动作连贯性显著下降,表明真实感引导在维持物理合理性方面具有关键作用。
  • OmniControl 在不同信号密度下均保持稳定性能,而 MDM 与 PriorMDM 在信号密度增加时,FID 与脚部滑移率急剧上升。
  • 该方法在 HumanML3D 与 KIT-ML 数据集上均达到最先进水平,无论在控制精度还是动作真实感方面均优于先前方法。
  • 该模型成功支持复杂下游应用,例如将生成动作与周围物体连接,通过单一统一框架实现多关节控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。