Skip to main content
QUICK REVIEW

[논문 리뷰] MotionMixer: MLP-based 3D Human Body Pose Forecasting

Arij Bouazizi, Adrian Holzbock|arXiv (Cornell University)|2022. 07. 01.
Human Pose and Action Recognition인용 수 4
한 줄 요약

MotionMixer는 다층퍼셉트론(MLP)만을 기반으로 하는 새로운 3D 인간 신체 자세 예측 모델로, 공간-시간 혼합을 통해 관절 간 상관관계와 시간적 의존성을 포착한다. 이 모델은 기존 방법보다 훨씬 적은 파라미터를 사용하면서도 Human3.6M, AMASS, 3DPW에서 최고 성능을 기록하며, 최고 성능 모델 대비 오차 감소율 최대 4%를 달성한다. 파라미터 수는 다음 최고 성능 모델의 0.5%에 불과하다.

ABSTRACT

In this work, we present MotionMixer, an efficient 3D human body pose forecasting model based solely on multi-layer perceptrons (MLPs). MotionMixer learns the spatial-temporal 3D body pose dependencies by sequentially mixing both modalities. Given a stacked sequence of 3D body poses, a spatial-MLP extracts fine grained spatial dependencies of the body joints. The interaction of the body joints over time is then modelled by a temporal MLP. The spatial-temporal mixed features are finally aggregated and decoded to obtain the future motion. To calibrate the influence of each time step in the pose sequence, we make use of squeeze-and-excitation (SE) blocks. We evaluate our approach on Human3.6M, AMASS, and 3DPW datasets using the standard evaluation protocols. For all evaluations, we demonstrate state-of-the-art performance, while having a model with a smaller number of parameters. Our code is available at: https://github.com/MotionMLP/MotionMixer

연구 동기 및 목표

  • RNN, CNN, GCN에 의존하지 않고 오직 MLP만을 사용하는 3D 인간 신체 자세 예측 모델을 개발하는 것.
  • 통합된 MLP 아키텍처를 통해 공간적 관절 관계와 시간적 운동 역학을 효율적으로 모델링하는 것.
  • 모델 복잡도와 계산 비용을 줄이면서도 예측 정확도를 유지하거나 향상시키는 것.
  • 각 시간 단계의 중요도를 스queeze-and-excitation 블록을 통해 재조정하여 장기 예측 성능을 향상시키는 것.
  • 최소한의 파라미터로 표준 벤치마크에서 최고 성능을 달성하는 것.

제안 방법

  • 모델은 이중 단계 MLP 아키텍처를 사용한다: 공간-MLP는 각 시간 단계의 관절 좌표를 처리하여 세밀한 공간적 의존성을 추출한다.
  • 시간-MLP는 시간 단계 간의 상호작용을 모델링하여 운동 역학을 포착한다.
  • 공간적 및 시간적 특징은 공유된 MLP 기반 혼합 메커니즘을 통해 혼합되어 공간적 및 시간적 의존성을 동시에 모델링한다.
  • 스퀴즈 앤 익스카이티드(SE) 블록을 적용하여 시퀀스 내 각 시간 단계의 영향력을 재조정함으로써 핵심 자세에 대한 주의를 향상시킨다.
  • 모델은 스택된 3D 자세 시퀀스를 처리하고, 최종 MLP 헤드를 통해 미래 자세를 디코딩한다.
  • 모델은 3D 관절 위치에 대한 평균 제곱오차 손실을 사용하여 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1순수한 MLP 기반 아키텍처가 RNN, CNN, GCN 기반 기존 모델보다 3D 인간 자세 예측에서 뛰어난 성능을 낼 수 있는가?
  • RQ2MLP를 통한 공간-시간 혼합이 복잡한 인간 운동 역학을 얼마나 효과적으로 포착하는가?
  • RQ3스퀴즈 앤 익스카이티드 블록이 시간 주의를 재조정함으로써 장기 예측 정확도를 얼마나 향상시키는가?
  • RQ4경량 MLP 모델이 기존 방법보다 훨씬 적은 파라미터로 최고 성능을 달성할 수 있는가?
  • RQ5모델은 Human3.6M, AMASS, 3DPW와 같은 다양한 동작과 데이터셋에 대해 얼마나 잘 일반화되는가?

주요 결과

  • MotionMixer는 Human3.6M, AMASS, 3DPW에서 최고 성능을 기록하며, 기존 최고 성능 모델 대비 평균 3.5mm의 3D 오차 감소를 달성한다.
  • 1000ms 예측 수평선에서 MotionMixer는 Human3.6M에서 평균 71.6mm의 3D 오차를 기록하여 다음 최고 성능 모델보다 오차 감소율 4%를 확보한다.
  • 25프레임을 예측하기 위해 단지 30.2k개의 파라미터와 2.1M FLOPs를 사용하며, 71.6mm 오차를 기록한다. 이는 57.5k개 파라미터를 사용하는 모델보다 3.8mm 더 낮은 오차를 기록한다.
  • 공간 또는 시간 혼합을 제거할 경우 각각 1000ms에서 오차가 4%와 6% 증가하여, 동시 모델링의 필요성을 확인한다.
  • 스퀴즈 앤 익스카이티드 블록은 모든 수평선에서 오차를 2mm 감소시켜 시간 재조정의 효과를 입증한다.
  • 자세 이동량 표현 방식을 사용할 경우 5mm의 성능 향상이 이루어져, 미리보지 않은 주체와 환경에 대한 일반화 능력 향상이 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.