Skip to main content
QUICK REVIEW

[논문 리뷰] MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video

Jinlu Zhang, Zhigang Tu|arXiv (Cornell University)|2022. 03. 02.
Human Pose and Action Recognition인용 수 13
한 줄 요약

MixSTE는 3D 인간 자세 추정을 위한 새로운 seq2seq 트랜스포머 기반 아키텍처를 제안하며, 각 관절의 시간적 운동을 별도로 모델링하기 위해 관절 분리 전략을 사용하고, 공간적 및 시간적 트랜스포머 블록을 번갈아가며 적용하여 시공간 일관성을 향상시킨다. 이는 기존 방법에 비해 기준 데이터셋에서 MPJPE를 7.6% 감소시키고 P-MPJPE를 10.9% 감소시켜 최신 기술 수준을 달성한다.

ABSTRACT

Recent transformer-based solutions have been introduced to estimate 3D human pose from 2D keypoint sequence by considering body joints among all frames globally to learn spatio-temporal correlation. We observe that the motions of different joints differ significantly. However, the previous methods cannot efficiently model the solid inter-frame correspondence of each joint, leading to insufficient learning of spatial-temporal correlation. We propose MixSTE (Mixed Spatio-Temporal Encoder), which has a temporal transformer block to separately model the temporal motion of each joint and a spatial transformer block to learn inter-joint spatial correlation. These two blocks are utilized alternately to obtain better spatio-temporal feature encoding. In addition, the network output is extended from the central frame to entire frames of the input video, thereby improving the coherence between the input and output sequences. Extensive experiments are conducted on three benchmarks (Human3.6M, MPI-INF-3DHP, and HumanEva). The results show that our model outperforms the state-of-the-art approach by 10.9% P-MPJPE and 7.6% MPJPE. The code is available at https://github.com/JinluZhang1126/MixSTE.

연구 동기 및 목표

  • 기존 방법이 각 프레임 간 개별 신체 관절의 별개의 운동 궤적을 모델링하는 데에 한계를 가진다는 문제를 해결하기 위해.
  • 출력을 단일 중심 프레임에서 전체 입력 시퀀스로 확장하여 3D 자세 추정의 시퀀스 일관성을 향상시키기 위해.
  • 중복된 시퀀스에 대한 반복적 추론을 피하기 위해 seq2seq 학습 철학을 채택함으로써 추론 효율성을 높이고 부작용을 줄이기 위해.
  • 긴 시퀀스에서도 높은 정확도와 시간적 매끄러움을 유지하면서도 유연한 입력 시퀀스 길이를 허용하기 위해.
  • 혼합 시공간 트랜스포머 인코더를 사용하여 3D 인간 자세 추정을 위한 새로운 효율적이고 정확한 기준 모델을 제공하기 위해.

제안 방법

  • 모델은 각 2D 관절점마다 개별 토큰으로 간주함으로써 관절별 시간적 운동 학습이 가능해지고, 시간 도메인 내 특징 차원을 감소시킨다.
  • 공간적 및 시간적 트랜스포머 블록을 번갈아가며 설계하여 점진적으로 전역적 시공간 표현을 구축한다.
  • 혼합 시공간 인코더(MixSTE)는 스택된 트랜스포머 레이어를 통해 관절 간 공간 상관관계와 개별 관절의 시간 역학을 통합한다.
  • 다중 손실 목적함수로 학습되며, 정확도를 위해 가중 MPJPE 손실, 시간 일관성 손실(TCLoss), 매끄러움을 위해 MPJVE 손실이 사용된다.
  • 임의의 길이의 입력 시퀀스를 지원하며, 전체 3D 자세 시퀀스를 출력함으로써 시간 일관성을 향상시키고 부작용 계산을 줄인다.
  • 엔드 투 엔드로 훈련 가능하며, 자기주의 주의 메커니즘을 활용해 프레임 간 및 관절 간 장거리 종속성을 모델링한다.

실험 결과

연구 질문

  • RQ1개별 관절의 운동 궤적을 모델링하면 긴 영상 시퀀스에서 3D 자세 추정 정확도가 향상되는가?
  • RQ2seq2seq 트랜스포머 아키텍처는 seq2frame 접근 방식에 비해 정확도, 매끄러움, 추론 효율성 측면에서 어떻게 비교되는가?
  • RQ3공간적 및 시간적 어텐션 블록을 번갈아가며 사용하면 3D 자세 추정에서 시공간 특징 학습이 얼마나 향상되는가?
  • RQ43D 자세 시퀀스 예측에서 정확도와 시간적 매끄러움을 균형 있게 유지하기 위해 가장 효과적인 손실 함수는 무엇인가?
  • RQ5혼합 시공간 트랜스포머 인코더는 성능 저하 없이 다양한 길이의 입력 시퀀스에 일반화할 수 있는가?

주요 결과

  • MixSTE는 Protocol 1 하에서 Human3.6M에서 40.9 mm의 MPJPE를 기록하여 이전 최신 기술 수준 방법 대비 7.6% 향상된 성능을 보였다.
  • 기존 SOTA 대비 P-MPJPE를 10.9% 감소시켜 긴 시퀀스에서 뛰어난 정확도를 입증했다.
  • 243프레임 입력 시퀀스에서 MixSTE는 40.9 mm의 MPJPE와 2.3 mm의 MPJVE를 기록하여 뛰어난 시간적 매끄러움을 보였다.
  • 제거 실험 결과, WMPJPE 손실, TCLoss, MPJVE 손실을 모두 조합할 경우 최고의 성능을 기록했으며, MPJVE는 2.3 mm 감소했다.
  • 모델은 높은 효율성을 유지하며, 전체 시퀀스 출력과 부작용 감소 덕분에 seq2frame 기반 모델보다 빠른 추론 속도를 기록했다.
  • 하이퍼파rameter 제거 실험 결과, 깊이 8, 모델 차원 512, 입력 길이 243일 때 최적의 성능을 기록했으며, 파라미터 증가율도 최소화되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.