Skip to main content
QUICK REVIEW

[論文レビュー] Human Mesh Recovery from Multiple Shots

Georgios Pavlakos, Jitendra Malik|arXiv (Cornell University)|Dec 17, 2020
Human Pose and Action Recognition参考文献 50被引用数 11
ひとこと要約

本稿では、映画のカット変更などの編集映像における時間的不連続性——例えばカット変更——を、複数の視点の手がかりとして活用することで、カット境界を越えて一貫性のある3次元人体メッシュシーケンスを回復するマルチショット最適化フレームワークを提案する。映画から擬似アノテーション3次元データを生成することで、単一画像メッシュ回復のロバスト性が向上し、欠損フレームが生じるカット変更に対応できる安定的かつ効果的なトランスフォーマー基盤の時系列モデルの構築が可能になる。

ABSTRACT

Videos from edited media like movies are a useful, yet under-explored source of information. The rich variety of appearance and interactions between humans depicted over a large temporal context in these films could be a valuable source of data. However, the richness of data comes at the expense of fundamental challenges such as abrupt shot changes and close up shots of actors with heavy truncation, which limits the applicability of existing human 3D understanding methods. In this paper, we address these limitations with an insight that while shot changes of the same scene incur a discontinuity between frames, the 3D structure of the scene still changes smoothly. This allows us to handle frames before and after the shot change as multi-view signal that provide strong cues to recover the 3D state of the actors. We propose a multi-shot optimization framework, which leads to improved 3D reconstruction and mining of long sequences with pseudo ground truth 3D human mesh. We show that the resulting data is beneficial in the training of various human mesh recovery models: for single image, we achieve improved robustness; for video we propose a pure transformer-based temporal encoder, which can naturally handle missing observations due to shot changes in the input frames. We demonstrate the importance of the insight and proposed models through extensive experiments. The tools we develop open the door to processing and analyzing in 3D content from a large library of edited media, which could be helpful for many downstream applications. Project page: https://geopavlakos.github.io/multishot

研究の動機と目的

  • 映画のような編集済みメディアにおける3次元人体メッシュ回復の課題に取り組むこと。カット変更によってフレームレベルの不連続性が生じる。
  • カット境界を独立したクリップとして扱う従来の手法の限界を克服し、時間的連続性を維持すること。
  • カット間での複数視点情報を利用することで、切断や隠蔽がある中でも3次元再構成の正確性を向上させること。
  • 映画から大規模な擬似アノテーション3次元人体メッシュデータセット(MS-AVA)を生成し、ロバストなメッシュ回復モデルの学習を可能とすること。
  • カット変更によるフレーム欠損を自然に処理できる純トランスフォーマー基盤の時系列エンコーダーを構築し、動画データにおける汎化性能を向上させること。

提案手法

  • 同じシーンの連続するカットを複数視点観測として扱い、カット境界を越えて3次元人体メッシュを統合的に最適化する。
  • カット遷移における時間的滑らかさと幾何学的整合性を強制するマルチショット最適化手順を定式化する。
  • 映画から回復された3次元シーケンスを擬似アノテーションの教師信号として用い、単一画像メッシュ回復モデル(例:HMR)の事前学習を行う。
  • 長距離時系列コンテキストに注目でき、欠損フレームを明示的に無視できる純トランスフォーマー基盤の時系列エンコーダー(t-HMMR)を設計する。
  • クリーンなシーケンスとカット由来の欠損フレームを含むシーケンスの両方でモデルを学習させ、ロバスト性を向上させる。
  • AVAデータセットに本フレームワークを適用し、35万フレームを超える3次元メッシュデータを生成。これを後続の学習・評価用にMS-AVAと呼ぶ。

実験結果

リサーチクエスチョン

  • RQ1編集映像におけるカット変更は、フレームレベルの不連続性が生じても、複数視点の信号として活用可能であり、3次元人体メッシュ再構成の精度向上に寄与するか?
  • RQ2マルチショット最適化により、単一ショットや独立したカット処理に比べ、より正確で一貫性のある3次元人体メッシュシーケンスが得られるか?
  • RQ3得られた擬似アノテーション3次元データ(MS-AVA)は、重度の切断がある状況下でも単一画像メッシュ回復モデルのロバスト性を向上させるか?
  • RQ4カット変更によるフレーム欠損を処理する際、純トランスフォーマー基盤の時系列エンコーダーは、畳み込み型や再帰型エンコーダーに比べて優れた性能を示すか?
  • RQ5学習時に不完全なシーケンス(フレーム欠損あり)を組み込むことで、カット境界を有する実世界の動画データに対する汎化性能が顕著に向上するか?

主な発見

  • 提案されたマルチショット最適化により、特に重度の切断や隠蔽がある状況下でも3次元メッシュ再構成の品質が顕著に向上した。
  • MS-AVAデータで学習したHMRは、3DPWにおけるPA-MPJPEを59.2mmから57.8mmに低下させ、困難な入力に対するロバスト性の向上を示した。
  • トランスフォーマー基盤の時系列モデル(t-HMMR)は、3DPWでPA-MPJPE 56.1mmを達成し、使用する学習データが少ないにもかかわらず、最先端の性能を同等または上回った。
  • トランスフォーマーのエンコーダーは、訓練の安定性に優れ、畳み込み型や再帰型エンコーダーがしばしば発散するのとは異なり、一貫して高性能なモデルに収束した。
  • AVA(フレーム欠損あり)において、すべてのシーケンスで学習したトランスフォーマー型モデルは、カット間PCKが73.8を達成し、畳み込み型(67.5)や再帰型(68.5)エンコーダーを上回った。
  • 定性的な結果から、t-HMMRは入力フレームがカット境界で不連続であっても、単一フレームのHMRに比べ、より時間的に一貫性のあるポーズを生成することがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。