Skip to main content
QUICK REVIEW

[论文解读] DMS-GCN: Dynamic Mutiscale Spatiotemporal Graph Convolutional Networks for Human Motion Prediction

Zigeng Yan, Di‐Hua Zhai|arXiv (Cornell University)|Dec 20, 2021
Human Pose and Action Recognition被引用 5
一句话总结

该论文提出DMS-GCN,一种前馈深度学习模型,利用动态多尺度时空图卷积网络,从10帧观测数据中预测人体运动。通过融合关节、骨骼和部件尺度表征,结合半自主学习的空间GCN与时间GCN模块,该模型在Human3.6M和CMU Mocap数据集上实现了最先进性能,参数量显著减少,推理速度更快。

ABSTRACT

Human motion prediction is an important and challenging task in many computer vision application domains. Recent work concentrates on utilizing the timing processing ability of recurrent neural networks (RNNs) to achieve smooth and reliable results in short-term prediction. However, as evidenced by previous work, RNNs suffer from errors accumulation, leading to unreliable results. In this paper, we propose a simple feed-forward deep neural network for motion prediction, which takes into account temporal smoothness and spatial dependencies between human body joints. We design a Multi-scale Spatio-temporal graph convolutional networks (GCNs) to implicitly establish the Spatio-temporal dependence in the process of human movement, where different scales fused dynamically during training. The entire model is suitable for all actions and follows a framework of encoder-decoder. The encoder consists of temporal GCNs to capture motion features between frames and semi-autonomous learned spatial GCNs to extract spatial structure among joint trajectories. The decoder uses temporal convolution networks (TCNs) to maintain its extensive ability. Extensive experiments show that our approach outperforms SOTA methods on the datasets of Human3.6M and CMU Mocap while only requiring much lesser parameters. Code will be available at https://github.com/yzg9353/DMSGCN.

研究动机与目标

  • 解决基于RNN的人体运动预测模型中的误差累积与信息丢失问题。
  • 通过在GCN中引入半自主学习的邻接矩阵,改进人体关节之间的空间依赖性建模。
  • 通过引入具有跨帧关节连接的时间图卷积网络(TGCNs),增强时间建模能力。
  • 设计一种动态多尺度架构,融合关节、骨骼和部件层级表征,以提升运动稳定性和预测准确性。
  • 相比现有方法,在降低模型复杂度的同时实现更优性能与更快的推理速度。

提出的方法

  • 通过聚类与平均池化,将人体姿态抽象为三种尺度:关节、骨骼和部件,以获得粗粒度表征。
  • 设计一种半自主学习的空间GCN,通过可学习掩码作用于邻接矩阵,限制长距离信息传递,实现自适应关节连接学习。
  • 构建连接连续帧中关节的时间边,以支持时间图卷积,实现时间维度上的信息流动。
  • 采用双流编码器-解码器框架:编码器使用时间GCN与半自主空间GCN提取时空特征,解码器使用时间卷积网络(TCNs)实现鲁棒的未来帧生成。
  • 通过网络内部的可学习注意力机制或拼接机制,实现多尺度表征的动态融合。
  • 以端到端、前馈方式训练整个模型,避免RNN中常见的误差累积问题。

实验结果

研究问题

  • RQ1前馈架构能否通过避免误差累积,在人体运动预测中超越基于RNN的模型?
  • RQ2多尺度时空GCN架构在建模人体运动分层表征方面效果如何?
  • RQ3在空间GCN中引入半自主学习的邻接矩阵,能否通过防止信息衰减与陷入局部最优,提升运动预测性能?
  • RQ4与标准GCN相比,具有帧间关节连接的时间GCN模块在时间建模方面提升程度如何?
  • RQ5所提方法在多样化动作与数据集上是否具备良好泛化能力,且参数开销极低?

主要发现

  • DMS-GCN在Human3.6M数据集上达到最先进性能,无论在短期还是长期运动预测中均优于先前方法。
  • 在CMU Mocap数据集上,DMS-GCN在短期预测中表现最佳,长期预测中也保持高度可靠性,尽管最后一帧性能略有下降。
  • 模型参数量显著减少——少于现有SOTA方法——同时推理速度更快,训练参数量与耗时对比验证了该结论。
  • 消融实验表明,多尺度架构提升了性能,完整三尺度模型优于仅使用较少尺度的变体。
  • 移除空间GCN中的掩码导致性能下降,验证了半自主学习机制的有效性。
  • 移除时间GCN模块导致性能显著下降,证明时间图卷积在建模运动动态中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。