Skip to main content
QUICK REVIEW

[논문 리뷰] Progressively Generating Better Initial Guesses Towards Next Stages for High-Quality Human Motion Prediction

Tiezheng Ma, Yongwei Nie|arXiv (Cornell University)|2022. 03. 30.
Human Pose and Action Recognition인용 수 8
한 줄 요약

이 논문은 다단계 인간 운동 예측 프레임워크를 제안하며, 지속적으로 보정되는 초도 예측값을 통해 미래 자세에 대한 점진적인 개선된 초기 추측을 생성한다. 지속적으로 보정되는 초도 예측값을 통해 미래 자세에 대한 점진적인 개선된 초기 추측을 생성한다. 공간적 및 시간적 밀도 있는 그래프 컨볼루션 네트워크(S-DGCN/T-DGCN)를 활용한 새로운 인코더-복사-디코더 네트워크를 사용하여, Human3.6M, CMU-MoCap, 3DPW에서 기존 방법 대비 예측 오차를 각각 6%-7%, 5%-10%, 13%-16% 감소시켜 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

This paper presents a high-quality human motion prediction method that accurately predicts future human poses given observed ones. Our method is based on the observation that a good initial guess of the future poses is very helpful in improving the forecasting accuracy. This motivates us to propose a novel two-stage prediction framework, including an init-prediction network that just computes the good guess and then a formal-prediction network that predicts the target future poses based on the guess. More importantly, we extend this idea further and design a multi-stage prediction framework where each stage predicts initial guess for the next stage, which brings more performance gain. To fulfill the prediction task at each stage, we propose a network comprising Spatial Dense Graph Convolutional Networks (S-DGCN) and Temporal Dense Graph Convolutional Networks (T-DGCN). Alternatively executing the two networks helps extract spatiotemporal features over the global receptive field of the whole pose sequence. All the above design choices cooperating together make our method outperform previous approaches by large margins: 6%-7% on Human3.6M, 5%-10% on CMU-MoCap, and 13%-16% on 3DPW.

연구 동기 및 목표

  • 미래 자세에 대한 보다 우수한 초도 예측값을 활용하여 고품질의 인간 운동 예측을 향상시키기 위해.
  • 지난 관측된 자세를 초도 예측값으로 사용하는 것의 한계를 해결하여 정확한 예측을 위한 최적의 초기 추측을 제공하기 위해.
  • 각 단계에서 다음 단계의 초도 예측값을 점차적으로 개선하는 다단계 프레임워크를 설계하여 전체 예측 정확도를 향상시키기 위해.
  • 공간과 시간을 모두 고려한 자세 역학을 효과적으로 모델링하기 위해 S-DGCN 및 T-DGCN를 활용한 스파atiotemporal 특징 추출 메커니즘을 개발하기 위해.
  • 전체 평균 또는 가우시안 필터링과 비교해 볼 때 누적 평균 스무딩(AAS)이 보다 우수한 중간 타겟 전략임을 검증하기 위해.

제안 방법

  • 각 단계에서 미래 자세 시퀀스의 스무딩된 버전을 중간 타겟으로 예측하는 다단계 설계를 채택한다.
  • 중간 타겟은 지속적으로 지정된 진짜 시퀀스를 평균화하여 점차적으로 더 스무딩된 근사치를 생성하는 누적 평균 스무딩(AAS)을 통해 생성된다.
  • 각 단계에서 인코더-복사-디코더 네트워크를 사용하며, '복사' 연산을 통해 인코더 출력을 디코더에 통합하여 장거리 의존성을 유지한다.
  • S-DGCN은 각 자세를 완전히 연결된 그래프로 모델링하여 관절 간의 공간적 관계를 처리하고, T-DGCN은 시퀀스 전반에 걸쳐 시간적 동역학을 포착한다.
  • S-DGCN과 T-DGCN를 번갈아가며 적용하여 전체 자세 시퀀스에 걸쳐 글로벌 스파atiotemporal 특징을 추출한다.
  • 최종 예측은 마지막 단계에서 이루어지며, 이 단계에서 초도 예측값이 목표 향후 자세 시퀀스로 정밀하게 보정된다.

실험 결과

연구 질문

  • RQ1다단계를 거쳐 점진적으로 초도 예측값을 개선하는 것이 인간 운동 예측 정확도를 향상시키는가?
  • RQ2전체 평균 또는 가우시안 필터링과 비교해 볼 때 누적 평균 스무딩(AAS)이 중간 타겟 생성 전략으로 더 우수한가?
  • RQ3표준 GCN과 비교해 전용 S-DGCN 및 T-DGCN 아키텍처를 사용할 경우 스파atiotemporal 특징 학습이 향상되는가?
  • RQ4단계 수가 예측 성능에 미치는 영향은 무엇이며, 최적의 구성은 무엇인가?
  • RQ5인코더-복사-디코더 네트워크의 '복사' 연산이 성능 향상에 기여하는 방식은 무엇인가?

주요 결과

  • 제안된 다단계 프레임워크는 이전 SOTA 방법 대비 Human3.6M에서 6%-7%의 오차 감소를 달성한다.
  • CMU-MoCap에서는 이전 접근 방식 대비 예측 오차를 5%-10% 감소시킨다.
  • 더 도전적인 3DPW 데이터셋에서는 예측 정확도가 13%-16% 향상된다.
  • 최적의 단계 수는 네 단계이며, 이 이상이 되면 성능이 정체되거나 저하된다.
  • AAS를 중간 타겟 전략으로 사용할 경우 전체 평균 또는 가우시안 필터링보다 우수한 성능을 보이며, 후자는 상당한 성능 저하를 보였다.
  • 디코더에서 '복사' 연산을 제거하면 오차가 65.02에서 65.99로 증가하여 장거리 의존성을 유지하는 데서 그 중요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.