Skip to main content
QUICK REVIEW

[논문 리뷰] Spatio-Temporal Gating-Adjacency GCN for Human Motion Prediction

Chongyang Zhong, Lei Hu|arXiv (Cornell University)|2022. 03. 03.
Human Pose and Action Recognition인용 수 10
한 줄 요약

이 논문은 인간 운동 예측을 향상시키기 위해 가중치를 학습하는 후보 인접 행렬들을 동적으로 융합하는 게이팅 네트워크를 사용하여 연속적인 관계와 시간적 의존성을 적응적으로 모델링하는 Spatio-Temporal Gating-Adjacency GCN(GAGCN)을 제안한다. 이 방법은 인접 행렬의 동적 조합을 통해 공간적 및 시간적 특징을 균형 있게 융합함으로써 Human 3.6M, AMASS, 3DPW에서 최고 성능을 달성하며, 다양한 동작 유형에 걸쳐 일반화 능력과 장기 예측 정확도를 크게 향상시킨다.

ABSTRACT

Predicting future motion based on historical motion sequence is a fundamental problem in computer vision, and it has wide applications in autonomous driving and robotics. Some recent works have shown that Graph Convolutional Networks(GCN) are instrumental in modeling the relationship between different joints. However, considering the variants and diverse action types in human motion data, the cross-dependency of the spatio-temporal relationships will be difficult to depict due to the decoupled modeling strategy, which may also exacerbate the problem of insufficient generalization. Therefore, we propose the Spatio-Temporal Gating-Adjacency GCN(GAGCN) to learn the complex spatio-temporal dependencies over diverse action types. Specifically, we adopt gating networks to enhance the generalization of GCN via the trainable adaptive adjacency matrix obtained by blending the candidate spatio-temporal adjacency matrices. Moreover, GAGCN addresses the cross-dependency of space and time by balancing the weights of spatio-temporal modeling and fusing the decoupled spatio-temporal features. Extensive experiments on Human 3.6M, AMASS, and 3DPW demonstrate that GAGCN achieves state-of-the-art performance in both short-term and long-term predictions.

연구 동기 및 목표

  • 다양한 동작 유형에 걸쳐 복잡하고 다양한 스펙트로-시간 의존성을 모델링하는 데 도전하는 것.
  • 다양한 동작 예측에 적용될 때 고정된 인접 행렬의 일반화 능력 부족 문제를 해결하는 것.
  • 개선된 특징 표현을 통해 오차 누적 문제를 완화함으로써 장기 예측 정확도를 향상시키는 것.
  • 균형 잡힌 융합 모델링을 통해 공간적 관계와 시간적 운동 경향 간의 상호의존성을 포착하는 것.
  • 미리 보지 않은 동작 유형에 잘 일반화되는 확장 가능한 적응형 GCN 아키텍처를 개발하는 것.

제안 방법

  • 모델은 다수의 후보 공간 및 시간 인접 행렬에 대한 혼합 계수를 학습하기 위해 게이팅 네트워크를 사용하여 입력에 따라 변하는 적응형 인접 행렬을 가능하게 한다.
  • 공간 및 시간 인접 행렬은 별도의 공간 및 시간 게이팅 네트워크에서 학습된 가중치를 사용하여 혼합된다.
  • 공간 및 시간 모델링의 기여도를 조절하기 위해 후보 행렬의 수를 조절함으로써 두 모odal 간의 트레이드오프를 제어한다 (예: S4, T3).
  • 공간 및 시간 특징은 크로네커 곱을 사용하여 융합되어 관절 관계와 시간 역학 간의 상호의존성을 포착한다.
  • 인코더는 GAGCN 레이어로 구성되며, 시퀀스-투-시퀀스 운동 예측을 위해 타임스탬프 컨volution 네트워크(TCN) 디코더를 사용한다.
  • 모델은 L2 손실을 사용하여 스켈레톤 기반 운동 시퀀스에서 엔드 투 엔드로 훈련되어 예측 정확도를 높인다.

실험 결과

연구 질문

  • RQ1게이팅 네트워크를 사용하여 다양한 인간 동작 유형에 걸쳐 일반화 가능한 적응형 인접 행렬을 효과적으로 학습할 수 있는가?
  • RQ2후보 인접 행렬의 수를 균형 있게 조절할 경우 GCN 기반 운동 예측에서 스펙트로-시간 모델링 성능에 어떤 영향을 미치는가?
  • RQ3분리된 공간 및 시간 특징을 융합함으로써 인간 운동 시퀀스의 상호의존성 모델링에 얼마나 기여하는가?
  • RQ4제안된 방법은 'Together Walking'과 같은 명시적인 훈련 데이터 없이도 미리 보지 않은 동작 유형에 잘 일반화되는가?
  • RQ5기존의 SOTA 방법과 비교해 볼 때 모델은 장기 예측에서 어떤 성능을 보이는가?

주요 결과

  • Human 3.6M 데이터셋에서 GAGCN은 80ms 시점에 10.1 mm의 3D 오차, 160ms 시점에 16.9 mm, 1000ms 시점에 72.9 mm의 오차를 기록하여 이전 방법들을 능가한다.
  • 장기 예측(1000ms)에서 GAGCN은 Human 3.6M에서 72.9 mm의 오차를 기록하여, 분석에서 다음으로 좋은 방법(93.9 mm)보다 유의미하게 낮은 오차를 기록한다.
  • 모델은 미리 보지 않은 동작에 잘 일반화된다: 'Walking Together'(미리 보지 않은)에서 13.1 mm의 오차를 기록했고, 'Walking'(보였던)에서는 10.1 mm의 오차를 기록하여 강력한 제로샷 일반화 능력을 보여준다.
  • 절단 분석 결과, 4개의 공간 및 3개의 시간 후보 행렬(S4, T3) 조합이 최고의 성능을 보였으며, 80ms에서 10.1 mm의 오차를 기록하여 수의 수를 줄인 설정보다 뛰어난 성능을 보였다.
  • 시각화 결과, 주기적인 운동(예: 'Walking')에 대해 매우 정확한 예측을 생성하고, 복잡한 비주기적 운동(예: 'Discussions', 'Posing')에 대해서도 합리적으로 정확한 결과를 도출함을 확인했다.
  • 공간 혼합 계수는 동작 유형에 따라 의미 있는 변화를 보였다: 'Walking'과 'Walking Together'는 ω3 및 ω4에 유사한 높은 값을 보였고, 'Discussions'와 'Sitting Down'은 다릅니다. 이는 동작 유형에 맞는 적응형 주의를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.