Skip to main content
QUICK REVIEW

[논문 리뷰] Double-chain Constraints for 3D Human Pose Estimation in Images and Videos

Hongbo Kang, Yong Wang|arXiv (Cornell University)|2023. 08. 10.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 이중 체인 그래프 컨volution 신경망과 자기주의 기반의 이중 분지 아키텍처를 통해 국소-전반적 및 전반적-국소 제약 조건을 통합하는 새로운 3D 인간 자세 추정 모델인 더블체인 그래프 컨volution 트랜스포머(DC-GCT)를 제안한다. 이는 Human3.6M 및 MPI-INF-3DHP에서 최신 기술 수준(SOTA) 성능을 달성하며, 검출된 2D 자세를 사용할 경우 MPJPE가 48.41mm이며, 자연스러운 이미지에 대해서도 뛰어난 일반화 성능을 보인다.

ABSTRACT

Reconstructing 3D poses from 2D poses lacking depth information is particularly challenging due to the complexity and diversity of human motion. The key is to effectively model the spatial constraints between joints to leverage their inherent dependencies. Thus, we propose a novel model, called Double-chain Graph Convolutional Transformer (DC-GCT), to constrain the pose through a double-chain design consisting of local-to-global and global-to-local chains to obtain a complex representation more suitable for the current human pose. Specifically, we combine the advantages of GCN and Transformer and design a Local Constraint Module (LCM) based on GCN and a Global Constraint Module (GCM) based on self-attention mechanism as well as a Feature Interaction Module (FIM). The proposed method fully captures the multi-level dependencies between human body joints to optimize the modeling capability of the model. Moreover, we propose a method to use temporal information into the single-frame model by guiding the video sequence embedding through the joint embedding of the target frame, with negligible increase in computational cost. Experimental results demonstrate that DC-GCT achieves state-of-the-art performance on two challenging datasets (Human3.6M and MPI-INF-3DHP). Notably, our model achieves state-of-the-art performance on all action categories in the Human3.6M dataset using detected 2D poses from CPN, and our code is available at: https://github.com/KHB1698/DC-GCT.

연구 동기 및 목표

  • 복잡한 관절 간 의존성을 모델링하여 2D 이미지에서의 3D 인간 자세 추정 문제의 불안정성(ill-posed nature)을 해결한다.
  • GCN의 과도한 평균화(over-smoothing) 문제와 트랜스포머의 구조적 기하학 무시 문제를 해결하여 다수준 관절 관계를 효과적으로 포착한다.
  • 낮은 계산 비용으로도 영상 시퀀스의 시간 정보를 효과적으로 통합할 수 있는 단일 프레임 3D 자세 업컨버전 모델을 개발한다.
  • 인간 뼈대의 구조적 및 맥락적 모델링을 향상시켜 제약 없는 자연 환경 이미지에 대한 일반화 성능을 향상시킨다.

제안 방법

  • 국소-전반적 및 전반적-국소 스트림을 별도로 운영하는 이중 체인 아키텍처를 설계하여 다수준 관절 의존성을 모델링한다.
  • 접근 관절 간 국소 공간적 관계를 포착하기 위해 그래프 컨volution 네트워크(GCN) 기반의 국소 제약 모듈(LCM)을 구현한다.
  • 모든 관절 간 장거리 전반적 관계를 모델링하기 위해 자기주의(self-attention)를 사용한 전반적 제약 모듈(GCM)을 설계한다.
  • 국소 및 전반적 브랜치 간 전이 단계에서 양방향 특징 교환을 가능하게 하기 위해 특징 상호작용 모듈(FIM)을 도입한다.
  • 대상 프레임의 공동 임베딩을 통해 영상 시퀀스 임베딩을 유도하여 단일 프레임 모델에 시간 정보를 통합한다.
  • 성능과 파라미터 수의 균형을 맞추기 위해 국소 및 전반적 브랜치 간 조정 가능한 채널 분할(C₁:C₂)을 통한 모델 용량 제어를 수행한다.

실험 결과

연구 질문

  • RQ1GCN와 자기주의를 조합한 이중 분지 아키텍처가 인간 자세 추정에서 국소 및 전반적 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2제안된 이중 체인 설계가 단일 분지 GCN 또는 트랜스포머 모델 대비 3D 자세 추정 정확도를 얼마나 향상시키는가?
  • RQ3영상 시퀀스의 시간 정보를 단일 프레임 3D 자세 추정 모델에 얼마나 효율적으로 통합할 수 있는가?
  • RQ4제안된 방법이 복잡한 가림, 검출 오차가 있는 복잡한 환경의 제약 없는 자연 이미지에 대해 잘 일반화되는가?
  • RQ5정확도와 계산 비용의 균형을 고려할 때 최적의 채널 분할 비율(C₁:C₂)과 입력 프레임 수는 무엇인가?

주요 결과

  • DC-GCT는 CPN에서 검출한 2D 자세를 사용할 경우 Human3.6M 데이터셋에서 기존 최고 성능을 갱신하는 48.41mm의 MPJPE를 달성하며, 모든 동작 유형에서 이전 방법들을 능가한다.
  • 81개의 입력 프레임을 사용할 경우 MPJPE가 44.73mm로 향상되며, 더 높은 프레임 수(예: 243개)에서는 성능 포화 상태에 도달함을 보여, 일정한 시퀀스 길이 이상에서는 수익 감소 현상이 나타남을 시사한다.
  • 최적의 이중 체인 구성은 C₁:C₂ = 1:4(C=160)로, 이는 48.41mm의 최저 MPJPE와 2.07M 파라미터를 기록한다.
  • MPI-INF-3DHP 데이터셋의 자연 환경 이미지에 대해 우수한 일반화 성능을 보이며, 다양한 실제 환경에서 3D 자세를 정확하게 예측한다.
  • 비록 성능 향상이 있었지만, 심한 가림, 반신체 자세, 2D 검출 오류 상황에서는 실패 케이스가 여전히 존재하여 강건한 추론에 대한 잔여 과제가 있음을 시사한다.
  • 단일 프레임 모델에 영상 수준의 시간적 맥락을 효과적으로 통합할 수 있는 계산 비용이 낮은 방법을 제안하며, FLOPs와 파라미터 수의 증가가 극히 미미하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.