Skip to main content
QUICK REVIEW

[논문 리뷰] MotionAGFormer: Enhancing 3D Human Pose Estimation with a Transformer-GCNFormer Network

Soroush Mehraban, Vida Adeli|arXiv (Cornell University)|2023. 10. 25.
Human Pose and Action Recognition인용 수 5
한 줄 요약

MotionAGFormer는 Transformer의 장거리 상관관계를 활용하고 별도의 GCNFormer 모듈을 통해 국소적인 공간-시간 관계를 통합함으로써 3D 인간 자세 추정을 향상시키는 새로운 하이브리드 Transformer-GCNFormer 아키텍처를 제안한다. 이 두 병렬 스트림의 적응형 융합은 Human3.6M에서 38.4 mm의 P1 오차와 MPI-INF-3DHP에서 16.2 mm의 P1 오차를 기록하며 최신 기술 수준(SOTA) 성능을 달성하였고, 이는 이전 SOTA 모델 대비 25% 적은 파라미터와 세 배 더 높은 계산 효율성을 확보하였다.

ABSTRACT

Recent transformer-based approaches have demonstrated excellent performance in 3D human pose estimation. However, they have a holistic view and by encoding global relationships between all the joints, they do not capture the local dependencies precisely. In this paper, we present a novel Attention-GCNFormer (AGFormer) block that divides the number of channels by using two parallel transformer and GCNFormer streams. Our proposed GCNFormer module exploits the local relationship between adjacent joints, outputting a new representation that is complementary to the transformer output. By fusing these two representation in an adaptive way, AGFormer exhibits the ability to better learn the underlying 3D structure. By stacking multiple AGFormer blocks, we propose MotionAGFormer in four different variants, which can be chosen based on the speed-accuracy trade-off. We evaluate our model on two popular benchmark datasets: Human3.6M and MPI-INF-3DHP. MotionAGFormer-B achieves state-of-the-art results, with P1 errors of 38.4mm and 16.2mm, respectively. Remarkably, it uses a quarter of the parameters and is three times more computationally efficient than the previous leading model on Human3.6M dataset. Code and models are available at https://github.com/TaatiTeam/MotionAGFormer.

연구 동기 및 목표

  • 표준 Transformer가 3D 인간 자세 시퀀스의 국소적 관절 의존성 구조를 포착하는 데 한계가 있음을 해결하기 위해.
  • 그래프 컨볼루션 네트워크(GCNs)의 국소적 인덕티브 바이어스를 전역적 어텐션 메커니즘과 통합하여 3D 자세 추정 정확도를 향상시키기 위해.
  • 실세계 적용을 위한 속도와 정확도의 균형을 고려한 계산 효율적이고 유연한 아키텍처를 개발하기 위해.
  • 프레임 단위로 처리하는 대신 단일 순방향 전파를 통해 전체 3D 자세 시퀀스를 예측함으로써 불필요한 계산을 제거하기 위해.
  • 향상된 인간 운동 구조 모델링을 위해 전역 및 국소 표현의 적응형 융합을 가능하게 하기 위해.

제안 방법

  • 관절 특징를 처리하기 위해 두 병렬 스트림을 사용하는 Attention-GCNFormer(AGFormer) 블록을 제안: 전역적 맥락을 위한 표준 Transformer와 국소적 공간-시간 관계를 위한 GCNFormer.
  • 학습 가능한 시간적 인접 행렬을 사용하여 국소적 관절 의존성을 모델링하는 GCNFormer 모듈을 도입하여 운동 기능적 구조의 표현을 향상시킴.
  • 학습 가능한 융합 가중치 없이도 전역 및 국소 인덕티브 바이어스를 균형 있게 유지할 수 있도록 Transformer 및 GCNFormer 스트림 간의 적응형 특징 융합을 구현.
  • 모델 수렴 및 성능 향상을 위해 시간적 위치 임베딩을 사용하며, 공간 또는 병합된 임베딩보다 우수한 성능을 기록함.
  • 깊이와 채널 너비를 조절하여 네 가지 변형(MotionAGFormer-B, -T, -S, -N)을 설계하여 속도와 정확도 간의 트레이드오���을 가능하게 함.
  • 입력 2D 프레임에서 전체 3D 시퀀스를 단일 순방향 전파로 회귀함으로써 레이어 간 중복 계산을 최소화하는 전략을 채택함.

실험 결과

연구 질문

  • RQ1Transformer와 GCN을 융합한 하이브리드 아키텍처가 단독 모델보다 3D 인간 자세 추정 성능을 향상시킬 수 있는가?
  • RQ2국소적 GCN 기반 모델링과 전역적 자기어텐션의 통합이 인간 운동 구조 모델링에 어떻게 기여하는가?
  • RQ33D 자세 추정에서 전역 및 국소 표현 간 최적의 융합 전략은 무엇인가?
  • RQ4경량 아키텍처가 계산 비용과 모델 크기를 줄이며 동시에 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5시간적 위치 임베딩의 사용이 순차 기반 3D 자세 복원에서 수렴성과 정확도를 향상시키는가?

주요 결과

  • MotionAGFormer-B는 Human3.6M 데이터셋에서 기존 SOTA 모델을 초월하는 새로운 최신 기술 수준의 P1 오차 38.4 mm를 기록함.
  • MPI-INF-3DHP 데이터셋에서 MotionAGFormer-B는 P1 오차 16.2 mm를 기록하여 다양한 벤치마크에 대한 강력한 일반화 능력을 입증함.
  • 이전 최고 성능 모델 대비 Human3.6M에서 파라미터 수를 25%로 줄이고 계산 효율성을 세 배 향상시킴.
  • 절단 분석 결과, Transformer 및 GCNFormer 스트림의 병렬 융합이 가장 높은 성능(38.4 mm P1)을 기록함. 순차적 융합이나 개별 모듈 대비 뛰어난 성능을 보임.
  • 시간적 위치 임베딩은 오차를 0.88 mm로 감소시키고 수렴 속도를 향상시키며, 공간적 임베딩만 사용할 경우 0.94 mm 오차를 기록함.
  • GCNFormer 모듈만으로도 57.5 mm P1 오차를 기록함으로써 최적의 결과를 얻기 위해 국소 및 전역 모델링의 융합이 필수적임을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.