Skip to main content
QUICK REVIEW

[논문 리뷰] Spatiotemporal Co-attention Recurrent Neural Networks for Human-Skeleton Motion Prediction

Xiangbo Shu, Liyan Zhang|arXiv (Cornell University)|2019. 09. 29.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 인체 관절 간의 공간적 일관성과 뼈대 간의 시간적 변화를 동시에 모델링하기 위해 스펙트로시아텀 공액 주의 순환 신경망(Spatiotemporal Co-attention Recurrent Neural Networks, SC-RNN)을 제안한다. 이는 뼈대-관절 공액 주의(Skeleton-joint Co-Attention, SCA) 메커니즘을 통해 공간적 및 시간적 차원에서 동적 주의 팩터를 학습함으로써, 기존 방법에 비해 인간 뼈대 운동 예측 성능을 향상시킨다. 장기 예측(1000ms)에서 기존 최고 성능 기법인 MHU 대비 평균 절대 오차(MAE)를 0.8 감소시켰다.

ABSTRACT

Human motion prediction aims to generate future motions based on the observed human motions. Witnessing the success of Recurrent Neural Networks (RNN) in modeling the sequential data, recent works utilize RNN to model human-skeleton motion on the observed motion sequence and predict future human motions. However, these methods did not consider the existence of the spatial coherence among joints and the temporal evolution among skeletons, which reflects the crucial characteristics of human motion in spatiotemporal space. To this end, we propose a novel Skeleton-joint Co-attention Recurrent Neural Networks (SC-RNN) to capture the spatial coherence among joints, and the temporal evolution among skeletons simultaneously on a skeleton-joint co-attention feature map in spatiotemporal space. First, a skeleton-joint feature map is constructed as the representation of the observed motion sequence. Second, we design a new Skeleton-joint Co-Attention (SCA) mechanism to dynamically learn a skeleton-joint co-attention feature map of this skeleton-joint feature map, which can refine the useful observed motion information to predict one future motion. Third, a variant of GRU embedded with SCA collaboratively models the human-skeleton motion and human-joint motion in spatiotemporal space by regarding the skeleton-joint co-attention feature map as the motion context. Experimental results on human motion prediction demonstrate the proposed method outperforms the related methods.

연구 동기 및 목표

  • 기존 RNN 기반 인간 운동 예측 방법이 시간 공간에서만 운동을 모델링하고 관절 간의 공간적 일관성을 忽略하는 한계를 해결하기 위해.
  • 통합된 프레임워크 안에서 인간 관절 간의 공간적 종속성과 뼈대 간의 시간적 동적 변화를 동시에 포착하기 위해.
  • 공간적 및 시간적 차원에서 관련된 이전 운동 상태에 대해 동적으로 주의를 기울임으로써 장기 운동 예측 정확도를 향상시키기 위해.
  • 뼈대-관절 특징 맵을 대상으로 공동 주의 팩터를 학습하는 새로운 주의 메커니즘을 개발하여 보다 정교한 운동 맥락 표현을 가능하게 하기 위해.

제안 방법

  • 관찰된 운동 시퀀스를 인코딩하는 뼈대-관절 특징 맵을 구축하며, 행은 관절 유형을 나타내고 열은 시간 프레임을 나타낸다.
  • 뼈대-관절 특징 맵 상에서 공간(관절) 및 시간(프레임) 차원에서 동적 주의 가중치를 학습하는 뼈대-관절 공액 주의(Skeleton-joint Co-Attention, SCA) 메커니즘을 설계한다.
  • SCA를 게이트드 순환 유닛(Gated Recurrent Unit, GRU)의 변종에 통합하여 뼈대-관절 공액 주의 GRU(SC-GRU)를 구성함으로써, 시공간 공간에서 인간 관절 및 인간 뼈대 운동을 동시에 모델링한다.
  • 예측된 운동 시퀀스의 구조적 일관성을 최적화하기 위해 가중치가 부여된 그램-행렬 손실 함수를 제안한다.
  • 전체 관찰된 운동 시퀀스를 운동 맥락으로 사용하며, SCA는 미래 자세 예측에 가장 관련성이 높은 맥락의 부분을 동적으로 정밀하게 조정한다.
  • H3.6M 데이터셋에서 SC-RNN 모델을 훈련 및 평가하여 ERD, LSTM-3LR, Res-GRU 및 MHU와 같은 최첨단 기법들과 성능을 비교한다.

실험 결과

연구 질문

  • RQ1관절 간의 공간적 일관성과 뼈대 간의 시간적 변화를 동시에 모델링함으로써 장기 인간 운동 예측 성능이 향상될 수 있는가?
  • RQ2공간적 및 시간적 차원에서 동시에 작용하는 공액 주의 메커니즘이 기존의 시간적 차원 전용 주의 메커니즘에 비해 운동 예측에서 어떻게 성능이 뛰어나게 되는가?
  • RQ3제안된 SCA 메커니즘이 관찰된 시퀀스에서 관련이 있는 관절과 프레임에 대해 선택적으로 주의를 기울임으로써 운동 맥락을 얼마나 정교하게 개선하는가?
  • RQ4GRU 기반 아키텍처에 SCA를 통합함으로써 표준 RNN 또는 주의 강화 RNN보다 더 정확하고 현실적인 운동 생성이 가능해지는가?
  • RQ5제안된 가중치가 부여된 그램-행렬 손실이 예측된 인간 운동 시퀀스의 구조적 정합성 향상에 기여하는가?

주요 결과

  • MHU 기법 대비 1000ms 장기 예측에서 평균 절대 오차(MAE)를 0.8 감소시켜 장기 정확도가 뛰어나다는 것을 입증하였다.
  • H3.6M 데이터셋에서 15개 인간 동작 중 12개에서 가장 낮은 MAE를 기록하였으며, '인사하기'와 '걷기' 동작에서 특히 뚜렷한 향상이 있었다.
  • 정성적 결과 분석에서 ERD, LSTM-3LR 및 Res-GRU 대비 손과 사지 위치 등 더 정확한 운동 세부 정보를 생성하는 것으로 나타났다.
  • SCA 메커니즘이 모델이 관련이 있는 관절과 시간 프레임에 동적으로 주의를 기울일 수 있도록 하여 맥락 표현과 예측 정밀도를 향상시켰다.
  • ERD 및 LSTM-3LR에 비해 장기 운동 예측에서 크게 앞서며, 시공간 공액 주의의 유용성을 확인하였다.
  • 제안된 가중치가 부여된 그램-행렬 손실은 예측된 운동 시퀀스의 구조적 일관성 향상에 기여하였으며, 실제값과의 정성적 비교를 통해 이를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.