[论文解读] MotionBERT: A Unified Perspective on Learning Human Motion Representations
MotionBERT 通过预训练一个双流时空 Transformer(DSTformer),从受损的 2D 骨骼序列中重建 3D 运动,提出了一种统一的框架,用于学习可泛化的运动表征。该方法在 3D 姿态估计、人体网格重建和动作识别等任务上通过微调预训练编码器与简单分类头,实现了最先进性能,展示了在多种以人为中心的视频任务中强大的迁移能力和通用性。
We present a unified perspective on tackling various human-centric video tasks by learning human motion representations from large-scale and heterogeneous data resources. Specifically, we propose a pretraining stage in which a motion encoder is trained to recover the underlying 3D motion from noisy partial 2D observations. The motion representations acquired in this way incorporate geometric, kinematic, and physical knowledge about human motion, which can be easily transferred to multiple downstream tasks. We implement the motion encoder with a Dual-stream Spatio-temporal Transformer (DSTformer) neural network. It could capture long-range spatio-temporal relationships among the skeletal joints comprehensively and adaptively, exemplified by the lowest 3D pose estimation error so far when trained from scratch. Furthermore, our proposed framework achieves state-of-the-art performance on all three downstream tasks by simply finetuning the pretrained motion encoder with a simple regression head (1-2 layers), which demonstrates the versatility of the learned motion representations. Code and models are available at https://motionbert.github.io/
研究动机与目标
- 开发一种统一框架,通过共享的运动表征解决多种以人为中心的视频任务。
- 通过从异构数据源(如 3D 动作捕捉数据、野外 RGB 视频和带动作标签的数据集)中学习可泛化的运动知识,解决数据来源异构的挑战。
- 通过在自监督的 2D 到 3D 运动重建任务上进行预训练,提升下游任务的迁移能力和性能。
- 设计一个通用的运动编码器,能够捕捉骨骼关节点之间的长程时空依赖关系。
- 通过部分微调共享单一预训练主干网络,实现在多个任务上的高效多任务推理。
提出的方法
- 使用自监督的掩蔽任务预训练运动编码器:从带有噪声和掩码的 2D 骨骼序列中重建 3D 人体运动。
- 采用双流时空 Transformer(DSTformer)作为运动编码器,其空间和时间注意力分支通过自适应方式融合。
- 在预训练过程中对 2D 骨骼序列应用随机掩码和噪声增强,以提升模型的鲁棒性和泛化能力。
- 利用多样化数据源:高精度 3D 动作捕捉数据和多样的野外 RGB 视频,以丰富运动表征学习。
- 为每个下游任务使用简单的回归头(1–2 层全连接层)微调预训练的运动编码器。
- 通过冻结运动编码器仅训练分类头,实现部分微调,从而支持高效的多任务部署。

实验结果
研究问题
- RQ1能否从异构的人体运动数据源中学习到统一的运动表征,以惠及多个下游任务?
- RQ2在 2D 到 3D 运动重建任务上进行预训练,是否能带来更具泛化性和可迁移性的运动表征?
- RQ3运动编码器中的架构选择(如双流注意力和融合机制)如何影响性能与泛化能力?
- RQ4单一预训练的运动编码器是否能在 3D 姿态估计、网格重建和动作识别等多样化任务上实现最先进性能?
- RQ5与从零开始训练或使用随机初始化相比,该预训练策略在多大程度上提升了下游任务性能?
主要发现
- 所提出的 2D 到 3D 重建预训练策略显著提升了下游性能:MPJPE 从随机初始化的 50.1mm 降低至 39.25mm(DSTformer 预训练后)。
- 预训练的运动编码器在 3D 姿态估计(MPJPE: 39.25 ± 0.27 mm)、网格重建(MPVE: 80.5 mm)和动作识别(1-shot 准确率: 60.7%)任务上均达到最先进水平。
- 部分微调(冻结预训练编码器仅训练分类头)仍能取得具有竞争力的结果,证明了所学表征的强大迁移能力。
- DSTformer 中的双流设计(S-T + T-S)优于单流和早期融合变体,证实了空间与时间建模互补性的优势。
- 在预训练中引入扰动并使用野外视频进一步提升了泛化能力,尤其在多样化下游任务中表现更优。
- 该方法在不同主干架构上均具通用性:TCN 和 PoseFormer 均从所提出的预训练中获益,证实了所学表征的普适性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。