[論文レビュー] Deep Inertial Poser: Learning to Reconstruct Human Pose from Sparse Inertial Measurements in Real Time
DIPは、実時間で6個のIMUだけから全身のSMPLポーズを再構築するために、トレーニングデータを合成し、リアルタイムのスライディングウィンドウを用いた双方向時系列モデリングを活用する深層リカレントネットワークを使用します。
We demonstrate a novel deep neural network capable of reconstructing human full body pose in real-time from 6 Inertial Measurement Units (IMUs) worn on the user's body. In doing so, we address several difficult challenges. First, the problem is severely under-constrained as multiple pose parameters produce the same IMU orientations. Second, capturing IMU data in conjunction with ground-truth poses is expensive and difficult to do in many target application scenarios (e.g., outdoors). Third, modeling temporal dependencies through non-linear optimization has proven effective in prior work but makes real-time prediction infeasible. To address this important limitation, we learn the temporal pose priors using deep learning. To learn from sufficient data, we synthesize IMU data from motion capture datasets. A bi-directional RNN architecture leverages past and future information that is available at training time. At test time, we deploy the network in a sliding window fashion, retaining real time capabilities. To evaluate our method, we recorded DIP-IMU, a dataset consisting of $10$ subjects wearing 17 IMUs for validation in $64$ sequences with $330\,000$ time instants; this constitutes the largest IMU dataset publicly available. We quantitatively evaluate our approach on multiple datasets and show results from a real-time implementation. DIP-IMU and the code are available for research purposes.
研究の動機と目的
- カメラ全体のセットアップなしで、6個のIMUから実時間で全身ポーズを再構成できることを実証する。
- 大規模モーキャプデータセットから生成した合成IMUデータを活用して深層モデルを訓練する。
- スパースなセンシング下での姿勢推定を改善するために、リカレントニューラルネットワークで時系列動態をモデル化する。
- 実データへの一般化を改善するために、加速度再構成と正規化を組み込む。
- 研究利用向けに公開可能な DIP-IMU データセットとコードを提供する。
提案手法
- SMPLメッシュ上に仮想センサを配置してIMUデータを合成し、フォワードキネマティクスによって向きを導出し、有限差分によって加速度を計算する。
- IMU入力をSMPLポーズパラメータへ写像する雙方向LSTMベースのRNNを訓練し、対数尤度損失を用いる。
- 入力加速度を再構成する補助タスクを用い、加速度情報がネットワークを通じて伝搬するようにする。
- 訓練中に目標ポーズを正規分布としてモデリングし、損失で対応する平均と分散を用いる。
- IMU入力を根系相対フレームで正規化して、ユーザの向きに対する方位不変性を実現する。
- 合成と実データ分布のギャップを埋めるために、事前学習済みモデルを実IMUデータでファインチューニングする。
実験結果
リサーチクエスチョン
- RQ16個のIMUはリアルタイムに正確な全身のSMPLポーズを提供できるか?
- RQ2モーキャプデータセットからの合成IMUデータをどのように活用して堅牢なポーズ推定器を訓練できるか?
- RQ3スパースなセンサ入力に対して、双方向の時間モデルは単方向モデルと比べてポーズ精度を向上させるか?
- RQ4実世界での一般化を向上させる訓練戦略(加速度再構成、正規化、正則化)は何か?
- RQ5テスト時にスライディングウィンドウを使用することの待機時間(レイテンシ)と精度への影響は何か?
主な発見
- 本手法は6 IMUからリアルタイムの全身ポーズ推定を達成する。
- スライディングウィンドウを用いた双方向時系列モデリングは、適度なレイテンシ(約85ミリ秒)で精度を向上させる。
- 補助的な加速度再構成タスクはポーズ予測を改善する。
- 合成IMUデータで訓練し、実データでファインチューニングすることで、合成と実測のギャップを狭める。
- DIPはTotalCaptureとDIP-IMUのベンチマークで角度誤差15.85度を達成し、リアルタイムで動作する競合のオフライン手法を上回る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。