Skip to main content
QUICK REVIEW

[논문 리뷰] SportsCap: Monocular 3D Human Motion Capture and Fine-grained Understanding in Challenging Sports Videos

Xin Chen, Anqi Pang|arXiv (Cornell University)|2021. 04. 23.
Human Pose and Action Recognition참고 문헌 61인용 수 4
한 줄 요약

SportsCap는 극복하기 어려운 스포츠 영상에서 단일 카메라 3D 인간 운동 캡처와 세분화된 동작 이해를 위한 새로운 프레임워크를 제안한다. 운동 임베딩 공간을 활용하여 의미적 및 시간적 사전 지식을 통합함으로써 3D 자세 추정과 하위운동 특성 예측을 동시에 향상시킨다. 이는 운동 캡처와 동작 분석 양 측면에서 최신 기술을 초월하며, SMART 데이터셋에서 61.7%의 정확도와 AQA 데이터셋에서 86.2%의 정확도를 달성한다.

ABSTRACT

Markerless motion capture and understanding of professional non-daily human movements is an important yet unsolved task, which suffers from complex motion patterns and severe self-occlusion, especially for the monocular setting. In this paper, we propose SportsCap -- the first approach for simultaneously capturing 3D human motions and understanding fine-grained actions from monocular challenging sports video input. Our approach utilizes the semantic and temporally structured sub-motion prior in the embedding space for motion capture and understanding in a data-driven multi-task manner. To enable robust capture under complex motion patterns, we propose an effective motion embedding module to recover both the implicit motion embedding and explicit 3D motion details via a corresponding mapping function as well as a sub-motion classifier. Based on such hybrid motion information, we introduce a multi-stream spatial-temporal Graph Convolutional Network(ST-GCN) to predict the fine-grained semantic action attributes, and adopt a semantic attribute mapping block to assemble various correlated action attributes into a high-level action label for the overall detailed understanding of the whole sequence, so as to enable various applications like action assessment or motion scoring. Comprehensive experiments on both public and our proposed datasets show that with a challenging monocular sports video input, our novel approach not only significantly improves the accuracy of 3D human motion capture, but also recovers accurate fine-grained semantic action attributes.

연구 동기 및 목표

  • 복잡한 스포츠 동작의 단일 카메라 영상에서 정확한 3D 인간 운동 캡처와 세분화된 동작 이해의 과제를 해결하기 위해.
  • 학습된 임베딩 공간 내에서 의미적 및 시간적으로 구조화된 하위운동 사전 지식을 활용하여 심한 자기 음영과 깊이의 모호성에 대비한 강건성을 향상시키기 위해.
  • 다중 작업 학습 프레임워크 내에서 3D 운동 캡처와 세부 동작 특성 예측을 동시에 최적화하기 위해.
  • 전문 스포츠 영상에 대한 풍부한 2D/3D 자세 주석과 세분화된 동작 레이블을 포함한 새로운 데이터셋(SMART)을 개발하기 위해.
  • 세부적인 의미적 운동 이해를 제공하여 운동 평가, 성과 평가, VR/AR 등의 실용적 응용을 가능하게 하기 위해.

제안 방법

  • 이 방법은 보행기, 복싱, 높이 뛰기와 같은 스포츠의 하위운동에 대해 가능한 자세 다양체를 모델링하기 위해 주성분 분석(PCA)을 사용한 운동 임베딩 공간을 도입한다.
  • 암묵적 운동 임베딩 네트워크는 프레임별 임베딩 파라미터를 추정하고, 매핑 함수를 통해 3D 운동 세부 정보를 복원하며, 하위운동 분류기는 중간 수준의 운동 카테고리를 식별한다.
  • 다중 스트림 공간-시간 그래프 컨volution 네트워크(ST-GCN)는 암묵적 임베딩과 명시적 3D 운동 스트림을 모두 처리하여 세분화된 의미적 동작 특성 속성을 예측한다.
  • 의미적 특성 매핑 블록은 관련된 동작 특성을 융합하여 통합적인 시퀀스 이해를 위한 고수준의 동작 레이블을 생성한다.
  • 프레임워크는 하위운동 분류를 위한 교차 엔트로피 손실을 사용하며, 운동 캡처와 동작 분석 작업을 동시에 학습한다.
  • 이 방법은 새로운 데이터셋(SMART)에서 학습되고, 동작 이해 및 운동 캡처를 평가하기 위해 SMART 및 AQA 데이터셋 모두에서 평가된다.

실험 결과

연구 질문

  • RQ1통합된 프레임워크가 단일 카메라 스포츠 영상에서 3D 인간 운동 캡처와 세분화된 동작 이해를 동시에 향상시킬 수 있는가?
  • RQ2학습된 임베딩 공간 내에서 의미적 및 시간적으로 구조화된 하위운동 사전 지식이 음영과 깊이의 모호성에 대비한 강건성을 어떻게 향상시킬 수 있는가?
  • RQ3암묵적 운동 임베딩과 명시적 3D 운동 세부 정보를 동시에 활용할 경우, 정확한 동작 특성 예측에 얼마나 기여할 수 있는가?
  • RQ4다중 스트림 ST-GCN이 암묵적 및 명시적 운동 표현을 효과적으로 모델링하여 세분화된 동작 분석을 수행할 수 있는가?
  • RQ5제안된 방법은 3D 자세 정확도와 동작 이해 성능 측면에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • SportsCap는 SMART 데이터셋에서 동작 분석에 대해 61.7%의 정확도를 달성하여 세분화된 의미적 동작 특성 예측에서 뛰어난 성능을 보였다.
  • 이 방법은 AQA 데이터셋에서 86.2%의 정확도를 기록하여 다양한 스포츠 운동 이해 작업으로의 일반화 능력이 뛰어나다는 것을 시사한다.
  • 운동 임베딩 모듈은 심한 자기 음영과 깊이의 모호성이 존재하는 단일 카메라 환경에서 3D 운동 캡처의 강건성을 크게 향상시켰다.
  • 의미적 특성 매핑이 적용된 다중 스트림 ST-GCN은 관련된 동작 특성과 고수준의 동작 레이블을 정확하게 예측할 수 있었다.
  • 공동 다중 작업 학습 프레임워크는 3D 운동 캡처와 동작 이해 간 상호 보완적 향상을 이끌었으며, 단일 작업 기반 베이스라인을 능가했다.
  • 실패 사례는 주로 알려지지 않은 자세, 극한의 음영, 또는 이미지 클리핑으로 인한 것으로, 드문 또는 불완전한 입력을 처리하는 데 향후 개선 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.