Skip to main content
QUICK REVIEW

[论文解读] 3D Human Motion Estimation via Motion Compression and Refinement

Zhengyi Luo, S. Alireza Golestaneh|arXiv (Cornell University)|Aug 9, 2020
Human Pose and Action Recognition参考文献 51被引用 10
一句话总结

该论文提出MEVA,一种两阶段3D人体动作估计方法:首先利用变分自编码器(VAE)将视频序列压缩为平滑、通用的动作表征,然后通过个性化的回归器对表征进行精细化处理,以恢复细微的动作细节。该方法在3DPW数据集上将加速度误差降低了54.3%,同时实现了最先进水平的MPJPE,实现了准确且时间上平滑的3D姿态序列。

ABSTRACT

We develop a technique for generating smooth and accurate 3D human pose and motion estimates from RGB video sequences. Our method, which we call Motion Estimation via Variational Autoencoder (MEVA), decomposes a temporal sequence of human motion into a smooth motion representation using auto-encoder-based motion compression and a residual representation learned through motion refinement. This two-step encoding of human motion captures human motion in two stages: a general human motion estimation step that captures the coarse overall motion, and a residual estimation that adds back person-specific motion details. Experiments show that our method produces both smooth and accurate 3D human pose and motion estimates.

研究动机与目标

  • 为解决当前最先进3D人体动作估计方法在保持高关节精度的同时缺乏时间平滑性的问题。
  • 将动作估计分解为粗粒度(通用)和细粒度(个体特异性)两个组件,以提升动作的合理性和准确性。
  • 学习一种解耦的动作表征,将平滑的共享人体动作与个体动作差异分离。
  • 在不牺牲空间精度的前提下,减少3D姿态序列中的抖动和不自然动作伪影。

提出的方法

  • 在AMASS数据集上训练变分自编码器(VAE),以学习表示平滑通用人体动作的低维潜在空间。
  • 通过数据增强技术(包括随机根部旋转、帧率变化和左右翻转)对VAE进行微调,以提升对未见动作变化的鲁棒性。
  • 通过解码VAE的潜在码生成粗粒度动作估计,表征整体平滑的动作轨迹。
  • 训练一个动作细化回归器(MRR),利用视频帧的图像信息预测从粗粒度估计中得出的残差偏移量。
  • 通过将MRR预测的残差加到VAE生成的粗粒度动作上,获得最终的3D姿态序列。
  • 整个框架采用两阶段训练方式:首先预训练VAE,然后在冻结的VAE基础上联合训练MRR。

实验结果

研究问题

  • RQ1两阶段动作估计框架是否能在不降低3D人体姿态估计空间精度的前提下提升时间平滑性?
  • RQ2基于VAE的动作压缩步骤在捕捉通用人体动作内在平滑性方面有多有效?
  • RQ3个性化细化模块在恢复通用动作模型未能捕捉的动作细节方面能达到何种程度?
  • RQ4与端到端训练相比,使用预训练的VAE潜在空间是否能提升泛化能力并减少运动学上无效的姿态?

主要发现

  • 与先前最先进方法相比,MEVA在3DPW数据集上将加速度误差降低了54.3%,显著提升了动作平滑性。
  • 消融实验证明,使用预训练VAE可生成更稳定、更合理的动作序列,避免了端到端训练中出现的运动学无效姿态。
  • 仅训练变分动作估计器(VME)即可达到与HMMR(一种先前SOTA方法)相当的低加速度误差性能。
  • 在VAE预训练阶段引入随机根部旋转、帧率变化和左右翻转增强,可使VAE在未见3DPW序列上的重建误差降低高达70%。
  • MEVA在3DPW数据集上实现了54.7的PA-MPJPE,优于以往方法,在精度与平滑性方面均表现更优。
  • 可视化结果表明,粗粒度动作捕捉了全局运动趋势,而残差细化则补充了如突然的手臂摆动或头部转动等动态、个体特异的细节。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。