Skip to main content
QUICK REVIEW

[논문 리뷰] DMS-GCN: Dynamic Mutiscale Spatiotemporal Graph Convolutional Networks for Human Motion Prediction

Zigeng Yan, Di‐Hua Zhai|arXiv (Cornell University)|2021. 12. 20.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 10개의 관측 프레임에서 인간 운동을 예측하기 위해 동적 다중스케일 시공간 그래프 컨볼루션 네트워크를 사용하는 피드포워드 딥 러닝 모델인 DMS-GCN을 제안한다. 관절, 뼈, 부위 수준의 표현을 반독립적으로 학습된 공간 GCN과 시간 GCN 블록을 통해 융합함으로써, Human3.6M 및 CMU Mocap에서 기존 최고 성능 모델을 뛰어넘는 성능을 달성하였으며, 파rameter 수가 크게 줄어들고 추론 속도가 빠르다.

ABSTRACT

Human motion prediction is an important and challenging task in many computer vision application domains. Recent work concentrates on utilizing the timing processing ability of recurrent neural networks (RNNs) to achieve smooth and reliable results in short-term prediction. However, as evidenced by previous work, RNNs suffer from errors accumulation, leading to unreliable results. In this paper, we propose a simple feed-forward deep neural network for motion prediction, which takes into account temporal smoothness and spatial dependencies between human body joints. We design a Multi-scale Spatio-temporal graph convolutional networks (GCNs) to implicitly establish the Spatio-temporal dependence in the process of human movement, where different scales fused dynamically during training. The entire model is suitable for all actions and follows a framework of encoder-decoder. The encoder consists of temporal GCNs to capture motion features between frames and semi-autonomous learned spatial GCNs to extract spatial structure among joint trajectories. The decoder uses temporal convolution networks (TCNs) to maintain its extensive ability. Extensive experiments show that our approach outperforms SOTA methods on the datasets of Human3.6M and CMU Mocap while only requiring much lesser parameters. Code will be available at https://github.com/yzg9353/DMSGCN.

연구 동기 및 목표

  • RNN 기반 인간 운동 예측 모델에서의 오차 누적과 정보 손실 문제를 해결한다.
  • GCN에 반독립적으로 학습된 인접 행렬을 도입하여 인간 신체 관절 간의 공간적 종속성 모델링을 향상시킨다.
  • 시간 간격 간의 관절 연결을 고려한 시간 그래프 컨볼루션 네트워크(TGCNs)를 사용하여 시간 모델링을 향상시킨다.
  • 관절, 뼈, 부위 수준의 표현을 융합하는 동적 다중스케일 아키텍처를 개발하여 운동 안정성과 예측 정확도를 향상시킨다.
  • 기존 방법들과 비교해 모델 복잡도가 감소하고 추론 속도가 빠른 초우수한 성능을 달성한다.

제안 방법

  • 클러스터링과 평균 풀링을 사용하여 관절, 뼈, 부위 수준의 근사 표현을 추출하여 군집화된 수준의 표현을 생성한다.
  • 학습 가능한 마스크를 인접 행렬에 적용하여 장거리 메시지 전파를 제한하고, 적응형 관절 연결 학습이 가능한 반독립적 학습 공간 GCN을 설계한다.
  • 연속된 프레임 간의 관절을 연결하여 시간 간선을 구성함으로써 시간 방향으로의 그래프 컨볼루션을 가능하게 한다.
  • 이중 스트림 인코더-디코더 프레임워크를 사용한다: 인코더는 시간 GCN과 반독립적 공간 GCN을 활용해 시공간 특징을 추출하고, 디코더는 시간 컨volution 네트워크(TCNs)를 사용해 향후 프레임을 안정적으로 생성한다.
  • 네트워크 내에서 학습 가능한 어텐션 또는 연결 기반 메커니즘을 통해 다중스케일 표현의 동적 융합을 구현한다.
  • 모델 전체를 종단 간 엔드 포워드 방식으로 훈련하여 RNN에서 흔히 발생하는 오차 누적 문제를 방지한다.

실험 결과

연구 질문

  • RQ1오차 누적 문제를 피하기 위해 피드포워드 아키텍처가 RNN 기반 모델을 능가할 수 있는가?
  • RQ2다중스케일 시공간 GCN 아키텍처는 계층적인 인간 운동 표현을 모델링하는 데 얼마나 효과적인가?
  • RQ3공간 GCN에 반독립적으로 학습된 인접 행렬이 정보 감쇠와 국소 최적해 문제를 방지함으로써 운동 예측 성능을 향상시키는가?
  • RQ4프레임 간 관절 연결을 고려한 시간 GCN 블록은 표준 GCN에 비해 시간 모델링을 얼마나 향상시키는가?
  • RQ5제안된 방법은 최소한의 파라미터 오버헤드로 다양한 동작과 데이터셋에 일반화 가능한가?

주요 결과

  • DMS-GCN은 Human3.6M 데이터셋에서 기존 최고 성능 모델을 뛰어넘는 성능을 달성하였으며, 단기 및 장기 예측 모두에서 뛰어난 결과를 보였다.
  • CMU Mocap 데이터셋에서는 단기 예측에서 최고 성능을 기록했고, 장기 예측에서도 최종 프레임에서 약간의 성능 저하가 있었음에도 불구하고 매우 안정적인 결과를 보였다.
  • 기존 SOTA 방법보다 훨씬 적은 파라미터를 사용하면서도 빠른 추론 속도를 유지를 하였으며, 훈련 시 파라미터 수와 시간 비용 비교를 통해 이를 확인하였다.
  • 절단 실험 결과 다중스케일 아키텍처가 성능 향상에 기여함을 입증하였고, 세 가지 스케일을 모두 포함한 전체 모델이 스케일 수가 적은 변형보다 뛰어난 성능을 보였다.
  • 공간 GCN에서 마스크를 제거하면 성능 저하가 발생함을 확인하여 반독립적 학습 메커니즘의 효과성을 입증하였다.
  • 시간 GCN 블록을 제거할 경우 성능이 크게 떨어지며, 이는 시간 그래프 컨볼루션의 운동 동역학 모델링에서 핵심적인 역할을 한다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.