Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Person Extreme Motion Prediction

W. Guo, Xiaoyu Bie|arXiv (Cornell University)|2021. 05. 18.
Human Pose and Action Recognition인용 수 9
한 줄 요약

이 논문은 두 사람이 상호작용하는 상황에서의 협업형 운동 예측을 소개하며, 향후 운동 예측 성능을 향상시키기 위해 두 사람의 과거 3D 자세를 함께 모델링하는 크로스 상호작용 어텐션(XIA) 모듈을 제안한다. 전문 댄서들이 극한의 린디홉 동작을 수행하는 새로운 ExPI 데이터셋에서 평가한 결과, 단기 예측에서는 최신의 단일 인물 기반 방법보다 10–40% 높은 정확도를, 장기 예측에서는 5–30% 높은 정확도를 기록하여 복잡한 인간 상호작용을 모델링하는 데 있어 뚜렷한 성과를 보였다.

ABSTRACT

Human motion prediction aims to forecast future poses given a sequence of past 3D skeletons. While this problem has recently received increasing attention, it has mostly been tackled for single humans in isolation. In this paper, we explore this problem when dealing with humans performing collaborative tasks, we seek to predict the future motion of two interacted persons given two sequences of their past skeletons. We propose a novel cross interaction attention mechanism that exploits historical information of both persons, and learns to predict cross dependencies between the two pose sequences. Since no dataset to train such interactive situations is available, we collected ExPI (Extreme Pose Interaction), a new lab-based person interaction dataset of professional dancers performing Lindy-hop dancing actions, which contains 115 sequences with 30K frames annotated with 3D body poses and shapes. We thoroughly evaluate our cross interaction network on ExPI and show that both in short- and long-term predictions, it consistently outperforms state-of-the-art methods for single-person motion prediction.

연구 동기 및 목표

  • 댄싱이나 팀 스포츠와 같은 높은 수준의 상호작용이 필요한 3D 인간 운동 예측 분야의 격차를 해소하기 위해.
  • 두 사람이 상호작용하는 동안의 운동 역학을 별개로 다루는 것이 아니라 함께 모델링하는 방법을 개발하기 위해.
  • 전문 댄서들이 극한의 상호작용적인 린디홉 동작을 수행하는 3D 자세와 형태 데이터를 포함한 새로운 대규모 고품질 데이터셋(ExPI)을 수집하고 공개하기 위해.
  • 정의된 훈련/테스트 분할과 평가 프로토콜을 포함해 협업형 운동 예측을 위한 벤치마크를 수립하기 위해.
  • 상호작용하는 사람 간의 의존성을 모델링함으로써 예측 정확도가 크게 향상됨을 입증하기 위해, 특히 발과 같은 고속도 관절에서 두드러진다.

제안 방법

  • 두 사람이 상호작용하는 동안의 과거 3D 자세 시퀀스를 함께 처리할 수 있도록 다중 헤드 어텐션을 확장한 새로운 크로스 상호작용 어텐션(XIA) 모듈을 제안한다.
  • XIA는 두 시퀀스에서 유도된 키, 쿼리, 밸류 벡터 간의 크로스 어텐션을 통해 두 사람 간의 상호작용 의존성을 동적으로 모델링한다.
  • XIA 모듈은 시퀀스에서 시퀀스로의 운동 예측 프레임워크에 통합되어, 각 시간 단계에서 상호작용하는 사람 간의 맥락을 통합함으로써 시간적 모델링을 향상시킨다.
  • 모델은 예측 오차를 동시에 최소화하는 연속적인 손실 함수를 사용해 엔드 투 엔드로 훈련된다.
  • 일반화 능력을 테스트하기 위해 공통 동작 분할, 단일 동작 분할, 그리고 알려지지 않은 동작 분할 설정에서 평가한다.
  • 제거 분석을 통해 XIA를 포즈 혼합, 연결, 별도의 모델과 같은 기준 모델과 비교하여, 크로스 어텐션 메커니즘이 뛰어난 성능을 보임을 확인한다.

실험 결과

연구 질문

  • RQ1운동 시퀀스에서 상호작용하는 사람 간의 의존성을 모델링하는 것이 상호작용적인 상황에서의 3D 인간 운동 예측 정확도를 뚜렷이 향상시킬 수 있는가?
  • RQ2극한의 고속도 상호작용에서 협업형 운동 예측의 성능은 단일 인물 기반 기준 모델에 비해 어떻게 비교되는가?
  • RQ3제안된 XIA 모듈은 다인승 환경에서 새로운 동작과 다양한 상호작용 유형에 일반화되는가?
  • RQ4공중 린디홉 동작에서 자주 공중에 뜨는 발과 같은 고속도 관절에서 XIA 모듈이 예측 정확도를 얼마나 향상시키는가?
  • RQ5높은 동적 특성을 띠는 상호작용 운동 시퀀스에서 장기 예측(500–1000ms)에 대해 모델의 성능은 어떠한가?

주요 결과

  • 제안된 XIA 모델은 단기 예측(≤500ms)에서 최신의 단일 인물 기반 방법보다 10–40% 높은 정확도를 기록한다.
  • 장기 예측(500–1000ms)에서는 단일 인물 기반 기준 모델 대비 정확도가 5–30% 향상된다.
  • XIA 모듈은 고속도 관절, 특히 공중 린디홉 동작에서 자주 날아다니는 따라하는 사람의 발에서의 예측 성능을 크게 향상시킨다.
  • 제거 분석을 통해 XIA를 통해 키와 밸류를 모두 업데이트하는 것이 가장 우수한 성능을 내며, XIA 없거나 부분적인 어텐션 업데이트를 사용한 모델보다 뛰어나다는 것이 확인되었다.
  • 알려지지 않은 동작 분할에서 XIA 모델은 대부분의 동작에서 기준 모델을 앞서며, 새로운 상호작용 유형에 대한 강건성을 보여준다.
  • XIA로 훈련된 모델는 별도의 개인별 모델을 사용한 모든 기준 모델보다 일관되게 뛰어난 성능을 보이며, 협업형 운동 예측에서 상호작용하는 사람 간의 모델링이 얼마나 가치 있는지 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.