[논문 리뷰] Deep Inertial Poser: Learning to Reconstruct Human Pose from Sparse Inertial Measurements in Real Time
DIP는 학습 데이터를 합성하고 실시간 슬라이딩 윈도우를 활용한 양방향 시계열 모델링으로 실시간에 6 IMU만으로 전체 신체의 SMPL 포즈를 재구성하기 위해 깊은 순환 네트워크를 사용한다.
We demonstrate a novel deep neural network capable of reconstructing human full body pose in real-time from 6 Inertial Measurement Units (IMUs) worn on the user's body. In doing so, we address several difficult challenges. First, the problem is severely under-constrained as multiple pose parameters produce the same IMU orientations. Second, capturing IMU data in conjunction with ground-truth poses is expensive and difficult to do in many target application scenarios (e.g., outdoors). Third, modeling temporal dependencies through non-linear optimization has proven effective in prior work but makes real-time prediction infeasible. To address this important limitation, we learn the temporal pose priors using deep learning. To learn from sufficient data, we synthesize IMU data from motion capture datasets. A bi-directional RNN architecture leverages past and future information that is available at training time. At test time, we deploy the network in a sliding window fashion, retaining real time capabilities. To evaluate our method, we recorded DIP-IMU, a dataset consisting of $10$ subjects wearing 17 IMUs for validation in $64$ sequences with $330\,000$ time instants; this constitutes the largest IMU dataset publicly available. We quantitatively evaluate our approach on multiple datasets and show results from a real-time implementation. DIP-IMU and the code are available for research purposes.
연구 동기 및 목표
- 전체 카메라 설정 없이 six IMUs에서 실시간 전체 바디 포즈 재구성을 시연한다.
- 대규모 모캅 데이터셋에서 생성된 합성 IMU 데이터를 활용해 깊은 모델을 학습한다.
- 희소 센싱 하에서 자세 추정 향상을 위해 순환 신경망으로 시간적 동역학을 모델링한다.
- 실제 데이터에 대한 일반화를 개선하기 위해 가속 재구성과 정규화를 도입한다.
- 연구용으로 공개 가능한 DIP-IMU 데이터셋과 코드를 제공한다.
제안 방법
- SMPL 메시에 가상 센서를 배치하고 전방 운동학으로 방향을 도출하고 유한 차분으로 가속도를 계산하여 IMU 데이터를 합성한다.
- IMU 입력을 SMPL 포즈 파라미터에 매핑하기 위해 bidirectional LSTM 기반 RNN을 학습하고 log-likelihood 손실을 사용한다.
- 보조 과제로 입력 가속도를 재구성하여 가속도 정보가 네트워크를 통해 전달되도록 한다.
- 훈련 시 목표 포즈를 Normal 분포로 모델링하고 손실에 대응하는 평균과 분산을 사용한다.
- 사용자 헤딩에 대한 방향 불변성을 달성하기 위해 루트 상대 프레임으로 IMU 입력을 정규화한다.
- 합성 데이터와 실제 분포 간의 격차를 줄이기 위해 실제 IMU 데이터로 사전 학습 모델을 미세 조정한다.
실험 결과
연구 질문
- RQ1Can six IMUs가 실시간으로 정확한 전체 바디 SMPL 포즈를 제공할 수 있는가?
- RQ2Mocap 데이터셋에서의 합성 IMU 데이터를 어떻게 활용해 강건한 포즈 추정기를 학습시킬 수 있는가?
- RQ3희소 센서 입력에 대해 양방향 시간 모델이 단방향 모델에 비해 포즈 정확도를 향상시키는가?
- RQ4실제 세계 일반화를 향상시키는 학습 전략(가속 재구성, 정규화, 규제화)은 무엇인가?
- RQ5테스트 시 슬라이딩 윈도우를 사용했을 때 지연(latency)과 정확도에 미치는 영향은 무엇인가?
주요 결과
- 이 방법은 6 IMUs로 실시간 전체 바디 포즈 추정을 달성한다.
- 슬라이딩 윈도우를 활용한 양방향 시간 모델링은 약 85 ms의 지연으로 정확도를 향상시킨다.
- 보조 가속 재구성 과제는 포즈 예측을 향상시킨다.
- 합성 IMU 데이터로 학습하고 실제 데이터로 미세 조정하는 것은 합성 데이터와 실제 측정 간의 차이를 좁힌다.
- DIP는 TotalCapture 및 DIP-IMU 벤치마크에서 각도 오차 15.85도를 달성하며, 실시간으로 실행되는 동안 경쟁적인 오프라인 방식보다 우수한 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.