Skip to main content
QUICK REVIEW

[논문 리뷰] SoMoFormer: Multi-Person Pose Forecasting with Transformers

Edward Vendrow, Satyajit Kumar|arXiv (Cornell University)|2022. 08. 30.
Human Pose and Action Recognition인용 수 11
한 줄 요약

SoMoFormer은 시간 시리즈 예측이 아닌 관절 궤적 모델링으로 포즈 예측을 재구성함으로써 다수의 사람에 대한 3D 인간 자세 예측을 위한 새로운 트랜스포머 기반 방법을 제안한다. 이는 모든 신체 관절의 궤적에 대해 관절 인식 자가주의를 사용하여, 상호 연관된 관절 간 및 사람 간 역학을 개선하고 장기 예측을 병렬로 수행할 수 있도록 한다. 이로 인해 SoMoF, CMU-Mocap 및 MuPoTS-3D 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Human pose forecasting is a challenging problem involving complex human body motion and posture dynamics. In cases that there are multiple people in the environment, one's motion may also be influenced by the motion and dynamic movements of others. Although there are several previous works targeting the problem of multi-person dynamic pose forecasting, they often model the entire pose sequence as time series (ignoring the underlying relationship between joints) or only output the future pose sequence of one person at a time. In this paper, we present a new method, called Social Motion Transformer (SoMoFormer), for multi-person 3D pose forecasting. Our transformer architecture uniquely models human motion input as a joint sequence rather than a time sequence, allowing us to perform attention over joints while predicting an entire future motion sequence for each joint in parallel. We show that with this problem reformulation, SoMoFormer naturally extends to multi-person scenes by using the joints of all people in a scene as input queries. Using learned embeddings to denote the type of joint, person identity, and global position, our model learns the relationships between joints and between people, attending more strongly to joints from the same or nearby people. SoMoFormer outperforms state-of-the-art methods for long-term motion prediction on the SoMoF benchmark as well as the CMU-Mocap and MuPoTS-3D datasets. Code will be made available after publication.

연구 동기 및 목표

  • 기존 방법이 단일 인물의 자세를 순차적으로 예측하거나 시간 시리즈로 자세를 모델링함으로써 관절 수준의 역학과 사회적 상호작용을 忽시하는 한계를 해결하기 위해.
  • 단일 순전파에서 다수의 사람에 대한 미래 운동 시퀀스를 엔드 투 엔드로 병렬 예측할 수 있도록 하기 위해.
  • 관절 궤적에 대한 주의를 활용하여 다수 인물 시나리오에서 신체 관절 간 및 개인 간 복잡한 관계를 모델링하기 위해.
  • 시간 시리즈 자세에서 관절 궤적 시퀀스로 입력 표현을 재고함으로써 장기 운동 예측 정확도를 향상시키기 위해.
  • 명시적인 그래프 구조나 순환 모듈 없이도 관절 인식 주의가 인간 신체 역학과 사회적 상호작용을 효과적으로 포착할 수 있음을 입증하기 위해.

제안 방법

  • 각 관절의 향후 궤적을 개별적으로 예측하는 방식으로 자세 예측을 재구성하며, 각 관절의 DCT 인코딩 궤적을 별도의 입력 토큰으로 간주한다.
  • 관절 유형, 사람 신원, 전역 공간 위치에 대한 학습 가능한 임베딩을 사용하여 각 관절 토큰을 풍부하게 한다.
  • 표준 트랜스포머 인코더를 사용하며, 동일하거나 다른 사람의 관절 간에 주의를 적용하는 다중 헤드 자가주의를 적용한다.
  • 격자 위치 임베딩을 연결하여 개인 간의 공간적 근접성과 전역 시나리오 레이아웃을 모델링한다.
  • 모든 사람의 관절 궤적을 한 번의 순전파에서 동시에 처리하여 순차적 또는 반복적 예측을 방지한다.
  • 트랜스포머의 병렬성 특성을 활용하여 반복 없이 전체 미래 자세 시퀀스를 예측함으로써 장기 수평에서 오차 누적를 감소시킨다.

실험 결과

연구 질문

  • RQ1시간 시리즈 예측이 아닌 관절 궤적 예측으로 자세 예측을 재구성할 경우, 다수 인물 시나리오에서 장기 운동 예측 정확도가 향상되는가?
  • RQ2명시적인 그래프 구조 없이도 자기주의 메커니즘이 관절 간 및 사람 간 관계를 얼마나 효과적으로 포착할 수 있는가?
  • RQ3운동 예측 과정에서 물리적으로 가까운 또는 역학적으로 관련된 관절에 더 강하게 주의를 기울이는가?
  • RQ4모델은 사람 수가 다양할 경우에도 일반화되어 고정된 성능을 유지할 수 있는가?
  • RQ5주의 가중치는 다수 인물 운동에서 실제 인간 신체 역학과 사회적 상호작용을 어떻게 반영하는가?

주요 결과

  • SoMoFormer은 SoMoF 벤치마크에서 최신 기술 수준(SOTA)을 초월하여 장기 3D 자세 예측에서 새로운 최고 성능을 달성한다.
  • CMU-Mocap 및 MuPoTS-3D 데이터셋에서도 뛰어난 성능을 기록하여 다양한 운동 시퀀스에 걸쳐 강력한 일반화 능력을 입증한다.
  • 주의 시각화 결과에서 관절은 가까운 관절이나 기능적으로 관련된 관절(예: 발에서 허리, 손에서 흉부로의 주의)에 강하게 주목하는 것으로 나타났으며, 이는 실제 신체 역학을 반영한다.
  • 명시적인 대칭 유도 편향 없이도 모델은 좌우 신체 측면 간 대칭적인 주의 패턴을 학습한다.
  • 사람 간 거리가 증가할수록 사람 간 주의 점수는 감소함을 확인하여, 모델이 사회적 상호작용 역학을 효과적으로 포착하고 있음을 입증한다.
  • 정성적 결과에서 SoMoFormer은 예를 들어 옆으로 걷는 복잡한 다수 인물 시나리오에서도 현실적이고 시간적으로 일관된 운동 시퀀스를 생성함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.