Skip to main content
QUICK REVIEW

[論文レビュー] LiDARCap: Long-range Marker-less 3D Human Motion Capture with LiDAR Point Clouds

Jialian Li, Jingyi Zhang|arXiv (Cornell University)|Mar 28, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、1台のLiDARセンサを用いた長距離・マーカーレス3次元人体モーションキャプチャのための新しいデータ駆動型手法、LiDARCapを提案する。新たに提案されたLiDARHuman26Mデータセットを用い、時間的符号化(PointNet++)、逆運動学、SMPL最適化の3段階パイプラインを採用することで、特に低解像度およびスパースな点群条件下で、RGBベースの手法に比べ優れた性能を達成した。

ABSTRACT

Existing motion capture datasets are largely short-range and cannot yet fit the need of long-range applications. We propose LiDARHuman26M, a new human motion capture dataset captured by LiDAR at a much longer range to overcome this limitation. Our dataset also includes the ground truth human motions acquired by the IMU system and the synchronous RGB images. We further present a strong baseline method, LiDARCap, for LiDAR point cloud human motion capture. Specifically, we first utilize PointNet++ to encode features of points and then employ the inverse kinematics solver and SMPL optimizer to regress the pose through aggregating the temporally encoded features hierarchically. Quantitative and qualitative experiments show that our method outperforms the techniques based only on RGB images. Ablation experiments demonstrate that our dataset is challenging and worthy of further research. Finally, the experiments on the KITTI Dataset and the Waymo Open Dataset show that our method can be generalized to different LiDAR sensor settings.

研究の動機と目的

  • LiDARを用いた大規模・長距離・マーカーレス3次元人体モーションキャプチャデータセットの不足を解消すること。
  • 距離に伴う画像品質の低下や低解像度の影響を受ける長距離環境において、RGBベースの手法の限界を克服すること。
  • LiDARの環境耐性および長距離深度センシングの利点を活かしたデータ駆動型モーションキャプチャパイプラインの開発。
  • スパースかつノイズの多い長距離LiDAR点群からも正確なポーズ推定が可能な強力なベースライン手法、LiDARCapの提供。
  • 実世界の自律走行ドライビングデータセットを用いて、さまざまなLiDARセンサ設定への一般化能力の検証。

提案手法

  • プロフェッショナルなIMUシステムを用いて同期されたLiDAR点群、RGB画像、および真値3次元人体ポーズを含む大規模かつマルチモodalなデータセット「LiDARHuman26M」を提案する。
  • スパースなLiDAR点群から階層的な空間的・時間的特徴を抽出するため、PointNet++を用い、長距離条件下でも頑健な表現学習を実現する。
  • 符号化された点群特徴に基づいて関節角度を精緻化する逆運動学ソルバを統合し、幾何学的整合性を確保する。
  • 予測された点群と観測された点群の差を最小化することで、3次元人体ボディ形状およびポーズパラメータを最適化するSMPL最適化器を採用する。
  • 3段階のパイプラインを設計する:(1) PointNet++による点群の時間的符号化、(2) 逆運動学を用いたポーズ回帰、(3) 最終的精緻化のためのSMPLベース最適化。
  • LiDARHuman26Mデータセット上で、エンドツーエンドに学習・評価を行い、各コンponentの貢献を検証するためのアブレーションスタディを実施する。
Figure 1 : Two scenes for data acquisition.
Figure 1 : Two scenes for data acquisition.

実験結果

リサーチクエスチョン

  • RQ1RGBベースの手法が失敗するような長距離条件下でも、単一のLiDAR点群のみを用いたデータ駆動型アプローチが、3次元人体モーションキャプチャを安定して達成できるか?
  • RQ2長距離・低解像度条件下で、LiDARベースのモーションキャプチャは、最先端のRGBベース手法と比較してどの程度の性能を示すか?
  • RQ3提案されたLiDARCap手法は、さまざまなLiDARセンサ設定および実世界の自律走行ドライビングデータセットへどの程度一般化可能か?
  • RQ4パイプライン内の各コンponent(例:PointNet++、IKソルバ、SMPL最適化器)が、全体のモーションキャプチャ精度に与える影響はどの程度か?
  • RQ5極端な距離における点群のスパarsityおよびノイズは、LiDARベースのモーションキャプチャにどのような影響を及ぼすか?また、本手法はこれらの課題に対しても精度を維持できるか?

主な発見

  • VIBEなどのRGBベースの最先端手法に比べ、LiDARCapは20メートルを超える距離で顕著に優れた性能を示し、長距離モーションキャプチャにおいて顕著な優位性を示した。
  • LiDARHuman26Mデータセット上で、平均関節位置誤差(MPJPE)は4.52 mmを維持し、スパースな点群でも高い精度を達成した。
  • アブレーションスタディにより、PointNet++と逆運動学、SMPL最適化の組み合わせが最良の性能をもたらすことが確認され、フルパイプラインはベースラインコンponentと比較してMPJPEを15.6%低減した。
  • KITTIおよびWaymo Open Datasetsにおいて、LiDARCapは実世界の歩行者モーションシーケンスに成功裏に一般化し、低密度な点群条件下でも正確に足跡や四肢の向きを予測した。
  • 距離の増加に伴い点数が減少(例:28 mでは30点未満)するが、LiDARCapは同じ条件下でVIBEよりも一貫性があり、より妥当なポーズを生成した。
  • LiDARHuman26Mデータセットは、スパースかつ長距離の点群において高精度を達成することが難しいことから、今後の研究に適した挑戦的で適切なデータセットであることが示された。
Figure 2 : Different human poses with the distance to LiDAR increasing.
Figure 2 : Different human poses with the distance to LiDAR increasing.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。