Skip to main content
QUICK REVIEW

[논문 리뷰] Markerless 3D human pose tracking through multiple cameras and AI: Enabling high accuracy, robustness, and real-time performance

Luca Fortini, Mattia Leonori|arXiv (Cornell University)|2023. 03. 31.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 다중 카메라 설정과 AI 기반 2D 자세 추정을 사용하는 마커리스 3D 인간 자세 추적 프레임워크를 제안한다. 가중치가 부여된 최소 제곱법(WLS)을 통한 데이터 융합을 통해 제약 조건이 없는 환경에서도 높은 정확도, 실시간 성능 및 강인성을 달성한다. 이 방법은 사용자 간섭을 최소화하고 다양한 애플리케이션에서 높은 신뢰성을 확보한 채 실세계 적용이 가능하다.

ABSTRACT

Tracking 3D human motion in real-time is crucial for numerous applications across many fields. Traditional approaches involve attaching artificial fiducial objects or sensors to the body, limiting their usability and comfort-of-use and consequently narrowing their application fields. Recent advances in Artificial Intelligence (AI) have allowed for markerless solutions. However, most of these methods operate in 2D, while those providing 3D solutions compromise accuracy and real-time performance. To address this challenge and unlock the potential of visual pose estimation methods in real-world scenarios, we propose a markerless framework that combines multi-camera views and 2D AI-based pose estimation methods to track 3D human motion. Our approach integrates a Weighted Least Square (WLS) algorithm that computes 3D human motion from multiple 2D pose estimations provided by an AI-driven method. The method is integrated within the Open-VICO framework allowing simulation and real-world execution. Several experiments have been conducted, which have shown high accuracy and real-time performance, demonstrating the high level of readiness for real-world applications and the potential to revolutionize human motion capture.

연구 동기 및 목표

  • 사용자 불편, 설정의 복잡성, 실세계 시나리오에서의 제한된 사용성 등 마커 기반 운동 캡처 시스템의 한계를 해결하기 위해.
  • 기존 마커리스 3D 자세 추정 방법에서 정확도, 실시간 성능 및 강인성 간의 상충 관계를 극복하기 위해.
  • 물리적 마커가 필요 없는 표준 RGB 카메라와 AI 기반 2D 자세 추정기만을 사용하여 실시간 3D 인간 운동 추적을 가능하게 하기 위해.
  • 다중 시야 2D 관절 검출 결과를 적응형 가중치를 사용해 융합하는 삼각측량 프레임워크를 개발하여, 가림 및 저신뢰도 예측 상황에서도 3D 재구성 정확도를 향상시키기 위해.
  • Open-VICO 프레임워크에 통합하여 다양한 환경에서 시뮬레이션 및 실세계 구현을 모두 지원하기 위해.

제안 방법

  • 공간적 다양성을 통해 시야 차단 문제를 방지하기 위해 다수의 RGB 카메라를 사용해 인간 운동의 동기화된 영상 스트림을 캡처한다.
  • OpenPose와 같은 AI 기반 2D 자세 추정을 활용해 각 카메라 시야에서 21개의 신체 관절을 검출하며, 신뢰도 점수와 가시성 지표를 입력으로 사용한다.
  • 2D 검출 결과로부터 3D 관절 위치를 재구성하기 위해 가중치가 부여된 최소 제곱법(WLS) 삼각측량 방법을 적용하여 가중 잔차를 최소화한다.
  • 각 관절과 카메라별로 적응형 가중치를 계산하며, 세 가지 구성 요소를 사용한다: 신뢰도 점수($w_{c,j}^s$), 거리 기반 신뢰성($w_{c,j}^d$), 수직성 지수($w_{c,j}^o$)를 통한 가시성.
  • 임계값 전략을 구현: 신뢰도 점수가 0.4 이하인 관절은 삼각측량에서 제외하여 노이즈와 이방성 값을 줄인다.
  • 재구성된 3D 관절에서 3D 세그먼트 각도와 해부학적 기준 프레임을 계산하기 위해 국제 생체역학 협회(ISB) 표준의 관절 좌표계(JCS)를 통합한다.

실험 결과

연구 질문

  • RQ1다중 시야 2D 자세 추정과 WLS 삼각측량 융합이 마커 없이 실시간 고정확도 3D 인간 자세 재구성에 성공할 수 있는가?
  • RQ2신뢰도, 거리, 가시성 기반 적응형 가중치가 가림 및 저품질 검출 상황에서 3D 자세 정확도를 어떻게 향상시키는가?
  • RQ3실세계 환경에서 기존 마커리스 3D 자세 추정 방법에 비해 제안된 프레임워크가 정확도와 지연 시간 측면에서 얼마나 뛰어난가?
  • RQ4특수 캘리브레이션 또는 통제된 배경이 필요 없이 다양한 환경과 복잡한 인간 운동 상황에서도 시스템이 강인한 성능을 유지할 수 있는가?
  • RQ5Open-VICO 플랫폼 내 통합이 시뮬레이션 및 실세계 구현 모두에서 얼마나 효과적인가?

주요 결과

  • 제안된 프레임워크는 제약 조건이 없는 환경에서 높은 정확도의 3D 인간 자세 재구성 성능을 달성하며, 마커 기반 시스템과 비교해 강력한 성능을 보였다.
  • 신뢰도, 거리, 가시성 기반 적응형 가중치의 사용은 특히 가림 및 저신뢰도 검출 상황에서 강인성을 크게 향상시켰다.
  • 시스템은 실시간으로 작동하며, VR, 로봇, 디지털 트윈과 같은 상호작용형 응용 분야에 적합한 낮은 지연 시간을 제공한다.
  • 신뢰도 점수가 0.4 이하인 관절을 임계값 전략을 통해 삼각측량에서 제외함으로써 오류 있는 2D 검출의 영향을 줄여 전체 삼각측량 정확도를 향상시켰다.
  • Open-VICO 프레임워크 내 통합을 통해 시뮬레이션 및 실세계 구현이 원활하게 가능해졌으며, 다양한 응용 분야에서의 실용적 구현 가능성을 검증했다.
  • 다양한 신체 자세와 카메라 구성에 걸쳐 강력한 일반화 성능을 보였으며, 재학습이나 복잡한 캘리브레이션 없이도 일관된 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.