Skip to main content
QUICK REVIEW

[論文レビュー] Contact-aware Human Motion Forecasting

Wei Mao, Miaomiao Liu|arXiv (Cornell University)|Oct 8, 2022
Human Pose and Action Recognition被引用数 7
ひとこと要約

本論文は、各関節ごとの距離に基づく接触マップを用いて、人間とシーンの相互作用を明示的にモデル化する接触認識型2段階フレームワークを提案する。将来の接触マップを予測し、それに基づいてポーズ予測を行うことで、合成データおよび実データの両方で、動きの正確性と現実性が著しく向上し、『ゴーストモーション』などのアーチファクトが解消される。3Dパスとポーズ予測の両面で、最先端の手法を上回る性能を発揮する。

ABSTRACT

In this paper, we tackle the task of scene-aware 3D human motion forecasting, which consists of predicting future human poses given a 3D scene and a past human motion. A key challenge of this task is to ensure consistency between the human and the scene, accounting for human-scene interactions. Previous attempts to do so model such interactions only implicitly, and thus tend to produce artifacts such as "ghost motion" because of the lack of explicit constraints between the local poses and the global motion. Here, by contrast, we propose to explicitly model the human-scene contacts. To this end, we introduce distance-based contact maps that capture the contact relationships between every joint and every 3D scene point at each time instant. We then develop a two-stage pipeline that first predicts the future contact maps from the past ones and the scene point cloud, and then forecasts the future human poses by conditioning them on the predicted contact maps. During training, we explicitly encourage consistency between the global motion and the local poses via a prior defined using the contact maps and future poses. Our approach outperforms the state-of-the-art human motion forecasting and human synthesis methods on both synthetic and real datasets. Our code is available at https://github.com/wei-mao-2019/ContAwareMotionPred.

研究の動機と目的

  • シーン認識型3D人間動き予測における、全体の動きと局所的ポーズの間の明示的制約の欠如に対処すること。
  • 人間とシーンの相互作用を暗黙的・非明示的にモデル化することによって生じる『ゴーストモーション』などのアーチファクトを排除すること。
  • 接触関係を明示的にモデル化することで、人間の動きとシーンの文脈との一貫性を向上させること。
  • まず将来の接触マップを予測し、その後それに条件づけたポーズ予測を行う2段階パイプラインを構築すること。
  • 複雑な3D環境下でも、より正確で現実的な人間の動き予測を達成すること。

提案手法

  • 各時刻における各人間関節から3Dシーン上のすべての点までの距離を符号化する、関節ごとの接触マップを導入する。
  • 先行研究の動き予測と同様に、DCTに基づく時系列符号化戦略を用いて、履歴の接触マップをモデル化する。
  • シーン点群、過去の動き、履歴の接触マップから、将来の接触マップを予測するための3Dシーン符号化ネットワーク(PVCNN)を採用する。
  • 動き予測の際には、予測された接触マップから各関節ごとに最も近い接触点を保持し、それらの点に条件づけて全体のトランスレーションと局所的ポーズ予測を行う。
  • 訓練中に予測されたポーズと接触点を用いて学習された事前分布を用いて、全体の動きと局所的ポーズの整合性を強制する。
  • アーチファクトの低減を目的として、接触マップの整合性と動きの現実性に対して明示的な監視を用いてモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1人間とシーンの接触関係を明示的にモデル化することで、3D人間動き予測の現実性と正確性が向上するか?
  • RQ2将来の接触マップを予測することで、局所的ポーズの変化と全体の動きの整合性はどのように向上するか?
  • RQ3暗黙的モデル化手法と比較して、接触認識型動き予測は『ゴーストモーション』などのアーチファクトをどの程度低減できるか?
  • RQ4接触マップ予測から始める2段階パイプラインは、エンドツーエンドのベースラインと比較して性能をどのように向上させるか?
  • RQ5真値の接触マップと予測された接触マップを用いる場合の、動き予測の正確性に及ぼす影響は何か?

主な発見

  • 提案手法は、合成データ(GTA-IM)および実世界データ(PROX)の両方において、3Dパスとポーズの正確性において、最先端の動き予測および合成手法を上回る。
  • GTA-IMでは、真値の接触マップを使用する場合と比較して、平均パス誤差が最大104mmまで低減され、予測された接触マップの有効性が示された。
  • アブレーション解析により、接触マップを削除すると、平均パス誤差が最大10mm、平均ポーズ誤差が最大7mm増加することが確認され、接触マップの重要性が裏付けられた。
  • 定性的な結果から、本手法は、歩行や座りなどの多様な動き、さらには壁への肘の接触のような複雑な相互作用に対しても、正確に接触マップを予測していることが示された。
  • DMGNN や SLT などのベースライン手法は、ゴーストモーションや家具を通り抜けるような不自然な動きを生成するが、本手法はこれらのアーチファクトを回避している。
  • 真値の接触マップを用いることで性能がさらに向上し、特にパスの正確性において顕著な向上が見られた。これは、接触マップ予測の品質が今後の改善における主要なボトルネックであることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。