Skip to main content
QUICK REVIEW

[논문 리뷰] EgoCap: Egocentric Marker-less Motion Capture with Two Fisheye Cameras

Helge Rhodin, Christian Richardt|Max Planck Digital Library|2016. 09. 23.
Human Pose and Action Recognition참고 문헌 68인용 수 7
한 줄 요약

EgoCap는 두 개의 헤드셋에 장착된 웨딩 렌즈 카메라를 사용하여 실시간, 마커리스 전신 동작 캡처를 구현하며, 생성적 자세 추정 모델과 컨볼루션 네트워크 기반 신체 부위 검출기를 결합하여 실내 및 실외 환경, 특히 혼잡한 장면을 포함한 제약 없는 환경에서도 가능하게 한다. 이는 몰입형 가상현실에 적용 가능하다.

ABSTRACT

Marker-based and marker-less optical skeletal motion-capture methods use an outside-in arrangement of cameras placed around a scene, with viewpoints converging on the center. They often create discomfort by possibly needed marker suits, and their recording volume is severely restricted and often constrained to indoor scenes with controlled backgrounds. Alternative suit-based systems use several inertial measurement units or an exoskeleton to capture motion. This makes capturing independent of a confined volume, but requires substantial, often constraining, and hard to set up body instrumentation. We therefore propose a new method for real-time, marker-less and egocentric motion capture which estimates the full-body skeleton pose from a lightweight stereo pair of fisheye cameras that are attached to a helmet or virtual reality headset. It combines the strength of a new generative pose estimation framework for fisheye views with a ConvNet-based body-part detector trained on a large new dataset. Our inside-in method captures full-body motion in general indoor and outdoor scenes, and also crowded scenes with many people in close vicinity. The captured user can freely move around, which enables reconstruction of larger-scale activities and is particularly useful in virtual reality to freely roam and interact, while seeing the fully motion-captured virtual body.

연구 동기 및 목표

  • 제한된 촬영 공간과 제어된 배경이 필요한 전통적인 외부에서 측정하는 동작 캡처 시스템의 한계를 해결하기 위해.
  • 신체에 부착된 센서 시스템(예: IMU, 외골격)이 요구하는 광범위한 장비 및 校정의 제약을 극복하기 위해.
  • 경량의 신체에 장착된 카메라 설정을 통해 제약 없는 대규모 및 혼잡한 환경에서 전신 동작 캡처를 가능하게 하기 위해.
  • 사용자의 자신의 신체를 3차원으로 재구성함으로써 몰입형 가상현실을 지원하는 방법을 개발하기 위해.
  • 강력한 실세계 구현을 지원하기 위한 에고세트릭 웨딩 렌즈 자세 추정을 위한 새로운 데이터셋과 학습 프레임워크를 구축하기 위해.

제안 방법

  • 헤드셋이나 VR 헤드셋에 장착된 웨딩 렌즈 카메라 스테레오 쌍을 사용하여 에고세트릭 시각에서 전체 신체를 촬영하기 위해.
  • 선형 사라짐 모델 기반의 레이 캐스팅 이미지 형성 모델에 기반한 생성적 자세 추정 프레임워크를 사용하여 분석적으로 미분 가능한 정렬 및 가시성 모델링을 가능하게 하기 위해.
  • 실제 에고세트릭 웨딩 렌즈 이미지의 인간 자세를 포함한 대규모 자동 애너테이션된 데이터셋에 기반해 훈련된 컨볼루션 네트워크 기반의 신체 부위 검출기를 통합하기 위해.
  • 장면 배경에 대한 스테레오 시각 기반 운동 복원(SfM)을 통해 전역 헤드기어 위치를 추론함으로써 국소 신체 자세 추정과 전역 머리 장치 위치를 분리하기 위해.
  • 웨딩 렌즈의 강한 투시 휨을 활용하여 깊이 및 근접도에 대한 운동 신호를 향상시켜 추적의 강건성을 향상시키기 위해.
  • 생성 모델과 CNN 검출 결과를 통합하여 자세와 가시성의 공동 최적화를 적용함으로써 자기 가림 및 복잡한 자세 상황을 처리하기 위해.

실험 결과

연구 질문

  • RQ1경량의 헤드셋에 장착된 스테레오 웨딩 렌즈 라이트가 제약 없는 실내 및 실외 환경에서 전신 마커리스 동작 캡처를 가능하게 할 수 있는가?
  • RQ2강한 왜곡이 있는 웨딩 렌즈 시각에서 분석적으로 미분 가능한 가시성 및 정렬 에너지를 갖춘 생성적 자세 추정 모델은 얼마나 효과적인가?
  • RQ3합성 및 실제 에고세트릭 웨딩 렌즈 데이터에 기반한 CNN 기반의 신체 부위 검출기가 자기 가림 및 혼잡한 상황에서 자세 추정 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4외부 센서 없이도 장면 배경에 대한 스테레오 시각 기반 운동 복원(SfM)이 전역 헤드기어 운동을 신뢰성 있게 추정할 수 있는가?
  • RQ5동적 장면에서 설정의 자유도, 사용자 편안함, 추적 강건성 측면에서 에고세트릭 웨딩 렌즈 설정은 기존의 외부 측정 또는 IMU 기반 시스템과 비교해 어떻게 다른가?

주요 결과

  • EgoCap는 오직 두 대의 헤드셋에 장착된 웨딩 렌즈 카메라만을 사용하여 실시간 마커리스 전신 동작 캡처를 성공적으로 수행하였으며, 대규모 및 혼잡한 장면에서도 강력한 성능을 보였다.
  • 생성적 자세 모델과 CNN 기반 검출기의 조합이 자기 가림 및 복잡한 신체 구조 상황에서 추적 정확도를 향상시켰다.
  • 장면 배경 기반의 스테레오 시각 기반 운동 복원(SfM)을 통해 국소 자세 추정과 전역 운동을 분리함으로써 안정적인 전역 자세 추정이 가능했다.
  • 웨딩 렌즈의 강한 투시 왜곡 덕분에 깊이 감지에 유리한 신호를 제공하여 카메라에 대해 앞뒤로 움직이는 동작을 더 잘 감지할 수 있었다.
  • 상업용 외부 측정 시스템에 비해 절대 정확도는 낮지만, 제약 없는 실세계 동작 캡처에 대한 타당성과 확장 가능성을 입증하였다.
  • 사용자의 자신의 시각에서 실시간으로 전신 가상 아바타를 재구성할 수 있어 몰입형 VR 응용 분야를 지원하였으며, 몰입감과 상호작용을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.