Skip to main content
QUICK REVIEW

[論文レビュー] Multi-level Motion Attention for Human Motion Prediction

Wei Mao, Miaomiao Liu|arXiv (Cornell University)|Jun 17, 2021
Human Pose and Action Recognition参考文献 5被引用数 4
ひとこと要約

本稿では、関節、ボディパーツ、全身ポーズの3レベルで、現在の運動状態と履歴部分列を比較することで、時間的反復を捉えるマルチレベル運動注意メカニズムを提案する。これらの注意タイプを統合し、学習可能なグラフ畳み込みネットワークを用いることで、再帰的構造や固定された時間的受容 field を用いず、長期間の運動パターンを効果的に活用し、Human3.6M、AMASS、3DPWで最先端の性能を達成する。

ABSTRACT

Human motion prediction aims to forecast future human poses given a historical motion. Whether based on recurrent or feed-forward neural networks, existing learning based methods fail to model the observation that human motion tends to repeat itself, even for complex sports actions and cooking activities. Here, we introduce an attention based feed-forward network that explicitly leverages this observation. In particular, instead of modeling frame-wise attention via pose similarity, we propose to extract motion attention to capture the similarity between the current motion context and the historical motion sub-sequences. In this context, we study the use of different types of attention, computed at joint, body part, and full pose levels. Aggregating the relevant past motions and processing the result with a graph convolutional network allows us to effectively exploit motion patterns from the long-term history to predict the future poses. Our experiments on Human3.6M, AMASS and 3DPW validate the benefits of our approach for both periodical and non-periodical actions. Thanks to our attention model, it yields state-of-the-art results on all three datasets. Our code is available at https://github.com/wei-mao-2019/HisRepItself.

研究の動機と目的

  • 誤差の蓄積や消失勾配の問題により、RNNベースのモデルが長期間の運動依存性を捉えきれないという限界を解消すること。
  • 個々のフレームではなく運動の方向性を捉えられず、関係のない行動間のポーズ類似性に敏感なフレームごとの注意メカニズムの欠点を克服すること。
  • 周期的でない複雑な動作(例:調理)においても、部分列の類似性を活用することで、運動の反復性を捉えること。
  • 再帰的ユニットや固定された時間的カーネルに依存せず、動的に関連する履歴運動パターンに注目できる、フォワードパスアーキテクチャを開発すること。
  • 多様な履歴シーケンスから運動パターンを学習することで、未観測のデータセットや長い予測ホライズンにおいて一般化性能を向上させること。

提案手法

  • 個々のフレームではなく、最近のフレームのシーケンス(現在の運動状態)と履歴の運動部分列を比較する運動注意を導入する。
  • 3つのレベルの運動注意を定義する:関節レベル(個々の関節)、ボディパーツレベル(関節のグループ化)、全身ポーズレベル(全ポーズ)、それぞれが異なる種類の運動反復を捉える。
  • 再帰的でなく、畳み込みを用いない方法として、離散コサイン変換(DCT)を用いて時間情報を符号化し、長距離の時間的モデリングを可能にする。
  • 関節間の空間的関係をモデル化するため、学習可能なグラフ畳み込みネットワーク(GCN)を適用し、固定された運動学的ツリーではなく、エンドツーエンドで学習されたグラフ構造を用いる。
  • 複数のレベルからの注意出力を、学習可能な重み付け機構を用いて統合し、現在の状況に最も関連する運動パターンを動的に選択する。
  • 予測された関節位置と角度の平均二乗誤差損失を用いて、自己回帰的生成なしに推論可能なフォワード形式でモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1部分列の類似性に基づく運動注意は、フレーム単位の注意と比較して、長期的人間の運動予測を改善できるか?
  • RQ2関節、ボディパーツ、全身ポーズの3レベルで運動反復性をモデリングすることで、多様な運動タイプにおいて性能が向上するか?
  • RQ3時間符号化の選択(DCT 対 RNN や畳み込み)が、予測精度と一般化性能に与える影響はいかほどか?
  • RQ4固定された運動学的ツリーではなく、学習可能なGCN接続行列を用いることで、性能はどの程度向上するか?
  • RQ5微調整なしに、未観測のデータセットや長い予測ホライズンに一般化可能か?

主な発見

  • 提案手法は、Human3.6M、AMASS、3DPWで最先端の性能を達成し、LTD(Mao et al., 2019)を含む先行SOTA手法をすべてのデータセットで上回った。
  • 関節、パーツ、ポーズの3レベルすべての運動注意を統合することで、関節位置予測において最良の性能が得られ、Human3.6Mにおける1000ms予測ホライズンで平均誤差を最大33.5%まで低減した。
  • 関節角度予測では、ポーズとパーツレベルの運動注意を統合することで、他の注意タイプを上回る割合が31.1%に達し、最低誤差を記録した。
  • 微調整なしに未観測のデータセットに一般化でき、Human3.6MとAMASSで学習したモデルが3DPWでも強い性能を維持した。
  • 学習可能なGCN接続行列を用いることで、事前に定義された運動学的ツリーを用いる場合と比較し、3D誤差を最大30%まで低減した。これは、エンドツーエンド構造学習の重要性を示している。
  • アブレーションスタディにより、DCTベースの時間符号化と学習可能なGCNが両方とも不可欠であることが確認された。両方の要素を除去すると、特に長期間予測において顕著な性能低下が生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。