Skip to main content
QUICK REVIEW

[논문 리뷰] DeepFuse: An IMU-Aware Network for Real-Time 3D Human Pose Estimation from Multi-View Image

Fuyang Huang, Ailing Zeng|arXiv (Cornell University)|2019. 12. 09.
Human Pose and Action Recognition참고 문헌 50인용 수 7
한 줄 요약

DeepFuse는 사전 정의된 뼈대 모델이 필요 없이 실시간 3D 인간 자세 추정을 위한 다중 시야 영상과 IMU 데이터를 융합하기 위해 이중 단계 3D CNN 네트워크를 제안한다. 다중 채널 볼륨 표현, Random Shut 데이터 증강 기법, 그리고 초기 융합을 위한 IMU-bone 레이어를 도입하여 TotalCapture에서 평균 오차 28.9 mm, Human3.6M에서 평균 오차 13.4 mm로 최신 기술 수준을 달성한다.

ABSTRACT

In this paper, we propose a two-stage fully 3D network, namely extbf{DeepFuse}, to estimate human pose in 3D space by fusing body-worn Inertial Measurement Unit (IMU) data and multi-view images deeply. The first stage is designed for pure vision estimation. To preserve data primitiveness of multi-view inputs, the vision stage uses multi-channel volume as data representation and 3D soft-argmax as activation layer. The second one is the IMU refinement stage which introduces an IMU-bone layer to fuse the IMU and vision data earlier at data level. without requiring a given skeleton model a priori, we can achieve a mean joint error of $28.9$mm on TotalCapture dataset and $13.4$mm on Human3.6M dataset under protocol 1, improving the SOTA result by a large margin. Finally, we discuss the effectiveness of a fully 3D network for 3D pose estimation experimentally which may benefit future research.

연구 동기 및 목표

  • 다른 모odal(쿼터니언 대비 볼륨 또는 픽셀) 간의 융합 문제를 해결하기 위해 IMU와 다중 시야 영상 데이터를 융합하는 데 초점한다.
  • 사전 정의된 뼈대 모델이 필요 없도록 하여 알려지지 않은 주체로의 일반화를 가능하게 한다.
  • 새로운 부피 표현 방식을 통해 다중 시야 입력의 기하학적 특성과 원시 데이터 특성을 유지한다.
  • Random Shut이라는 새로운 데이터 증강 기법을 통해 훈련 중 카메라 가림을 시뮬레이션하여 모델의 일반화 능력을 향상시킨다.
  • 특징 수준에서 IMU와 시각 모달을 깊이 있게 융합함으로써 실시간으로 고정도 3D 자세 추정을 달성한다.

제안 방법

  • 다중 시야 영상을 기하학적 카메라 관계와 데이터 원시성을 유지하는 다중 채널 볼륨으로 표현한다.
  • 훈련 중에 카메라 시야를 무작위로 마스킹하여 부분적 가림을 시뮬레이션하는 데이터 증강 기법인 Random Shut을 도입한다.
  • 시각 브랜치의 최종 활성화로 3D 소프트-아르그맥스 레이어를 사용하여 부피 공간 내에서 미분 가능한 관절점 국소화를 가능하게 한다.
  • IMU-빈 레이어를 제안하여 IMU 쿼터니언 데이터를 뼈대 길이 인식 특징으로 변환함으로써 공통 3D 공간에서 시각 특징과 조기에 융합할 수 있도록 한다.
  • 이중 단계 네트워크를 사용한다: 첫 번째 단계는 초기 3D 자세 추정을 위한 시각 전용 3D CNN이며, 두 번째 단계는 융합된 IMU 및 시각 특징을 사용해 예측값을 보정하는 IMU 보정 단계이다.
  • 소프트-아르그맥스 함수의 온도 매개변수 θ를 사용하여 고활성 볼륨에 대한 주의를 조절하며, 아블레이션 테스트에서 θ=3이 최적임을 확인하였다.

실험 결과

연구 질문

  • RQ1사전 정의된 뼈대 모델에 의존하지 않고도 IMU와 다중 시야 영상 데이터를 조기에 융합하여 3D 인간 자세 추정 정확도를 향상시킬 수 있는가?
  • RQ2다중 채널 볼륨 표현 방식은 2D 기반 방법 대비 기하 정보 유지 및 3D 자세 추정 향상에 얼마나 효과적인가?
  • RQ3Random Shut 데이터 증강 기법은 부분적 카메라 가림 상황에서 모델의 일반화 능력을 향상시키는가?
  • RQ4완전 3D CNN에서 관절점 국소화에 소프트-아르그맥스, 하드-아르그맥스, 또는 직접 회귀(완전 연결층)를 사용할 경우의 영향은 무엇인가?
  • RQ5부피 입력과 소프트-아르그맥스를 사용하는 완전 3D CNN은 2D 또는 하이브리드 접근 방식에 비해 더 빠른 수렴과 향상된 성능을 달성할 수 있는가?

주요 결과

  • DeepFuse는 TotalCapture 데이터셋에서 평균 관절 오차 28.9 mm, Human3.6M에서 프로토콜 1 기준 13.4 mm를 기록하여 이전 최신 기술 수준의 방법들을 크게 능가한다.
  • 다중 채널 볼륨 표현 방식은 TotalCapture와 Human3.6M에서 각각 2D 소프트-아르그맥스 기반 베이스라인 대비 오차를 23.6%와 28.9% 감소시켰다.
  • Random Shut은 부분적으로 촬영된 프레임에서 특히 모델의 일반화 능력을 향상시키며, 아블레이션 연구에서 성능 향상을 입증하였다.
  • 3D 소프트-아르그맥스 레이어는 하드-아르그맥스 및 직접 회귀(완전 연결층을 통한) 방식보다 우수한 성능을 보였으며, 오차는 각각 32.7 mm, 39.7 mm, 45.2 mm였다.
  • 모델는 매우 빠른 수렴을 보였으며, 첫 번째 에포크 내에 최신 기술 수준 성능에 도달하였다. 이는 3D 부피 표현 방식이 중복 매핑 없이 공간적 구조를 효과적으로 포착하고 있음을 시사한다.
  • 소프트-아르그맥스의 최적 온도 매개변수 θ=3은 고활성 볼륨에 대한 주의를 적절히 조절하며 과적합을 방지함을 아블레이션(θ=1에서 100까지의 값)을 통해 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.