Skip to main content
QUICK REVIEW

[論文レビュー] Human Motion Anticipation with Symbolic Label

Julian Tanke, Andreas Weber⋆|arXiv (Cornell University)|Dec 12, 2019
Human Pose and Action Recognition参考文献 31被引用数 6
ひとこと要約

本論文は、過去の動きと予測された意図を活用して、未来的な未来のポーズを生成する前に、記号的行動ラベル(例:歩行、立ち位置)を予測する、新しい人間の動き予測フレームワークを提案する。未来の記号的ラベルに条件づけられたポーズ生成により、Human 3.6M データセット上で4秒までの長期的動き予測において、最先端の性能を達成し、平均ポーズの劣化を顕著に低減するとともに、動きの滑らかさを向上させた。

ABSTRACT

Anticipating human motion depends on two factors: the past motion and the person's intention. While the first factor has been extensively utilized to forecast short sequences of human motion, the second one remains elusive. In this work we approximate a person's intention via a symbolic representation, for example fine-grained action labels such as walking or sitting down. Forecasting a symbolic representation is much easier than forecasting the full body pose with its complex inter-dependencies. However, knowing the future actions makes forecasting human motion easier. We exploit this connection by first anticipating symbolic labels and then generate human motion, conditioned on the human motion input sequence as well as on the forecast labels. This allows the model to anticipate motion changes many steps ahead and adapt the poses accordingly. We achieve state-of-the-art results on short-term as well as on long-term human motion forecasting.

研究の動機と目的

  • 誤差の蓄積により、既存のモデルが平均ポーズに収束してしまうという、長期的動き予測の課題に対処すること。
  • より高いレベルの意図を記号的行動ラベルを通じて組み込むことで、完全な3次元ポーズよりも予測が容易なラベルを用いて、動き予測を改善すること。
  • 未来の行動を予測することで、前もって動きの変化を予測し、現実的なポーズ生成を可能にすること。
  • 記号的表現の質が動き予測性能に与える影響を評価すること。これは、教師ありおよび教師なしのラベル抽出を含む。
  • 記号的ラベル予測が敵対的訓練とどのように相乗効果をもたらすかを示すこと。

提案手法

  • モデルは、過去のポーズを入力として、観測された動き系列から記号的行動ラベルを予測する、シーケンス・ツー・シーケンスの再帰的ネットワークを用いる。
  • 記号的ラベル抽出モジュールは、観測されたポーズからフレームごとの行動カテゴリの確率を予測し、エンド・ツー・エンドの学習を可能にする。
  • 未来の記号的ラベルは、過去のポーズと連結され、別々の再帰的エンコーダ(ポーズエンコーダおよびラベルエンコーダ)によって処理され、コンテキストベクトルを形成する。
  • 再帰的ポーズ生成器は、過去のポーズ系列および過去と未来の両方の記号的ラベルに条件づけられた未来のポーズを生成することで、予測可能な動き合成を実現する。
  • 訓練段階で、初期の予測を安定化させ、不連続性を低減するために、ウォームアップ戦略(教師強制)を採用する。
  • 本フレームワークは、教師ありラベル(11種類の人がラベル付けした行動)および教師なしクラスタリング(k=11~32)を用いた、記号的表現学習をサポートする。

実験結果

リサーチクエスチョン

  • RQ1直接的なポーズ回帰と比較して、記号的行動ラベルの予測が、長期的動き予測の性能向上に寄与するか。
  • RQ2未来の記号的ラベルの組み込みが、生成された動き系列の現実性および滑らかさに与える影響は何か。
  • RQ3記号的表現の質(例:k=11 と k=32)が、動き予測性能に与える影響は何か。
  • RQ4特に長期予測(例:4秒)において、時間の範囲に応じてモデルの性能はどのように変化するか。
  • RQ5記号的ラベル予測が、敵対的訓練とどの程度相乗効果をもたらすか。

主な発見

  • 本モデルは、Human 3.6M データセットにおいて、4秒までの動き予測において、最先端の性能を達成し、既存の手法を上回った。
  • 25フレームの予測予測期間において、人間ラベル付きの行動を用いると、記号的ラベルの予測精度が78%に達した。
  • 教師なしクラスタリング(k=11)を用いる場合、ラベル予測精度は67%に低下したが、依然として長期的予測において強い性能を示した。
  • 本モデルは平均ポーズの劣化を顕著に低減した:記号的ラベルなしでは、約1秒後に動きが平均ポーズに凍結してしまうが、ラベルありでは数秒にわたり一貫性が保たれた。
  • アブレーションスタディにより、ラベルエンコーディングとポーズエンコーディングの両方が重要であることが確認された。両方を欠落させると性能が著しく低下し、特にラベルを完全に欠落させた場合が最も悪い結果を示した。
  • より長いウォームアップ期間(w ≥ 1)を採用することで、長期的性能が向上した。これは、ウォームアップが安定した動き状態への早期収束を支援していることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。