Skip to main content
QUICK REVIEW

[論文レビュー] Sim2real transfer learning for 3D pose estimation: motion to the rescue

Carl Doersch, Andrew Zisserman|arXiv (Cornell University)|Jul 4, 2019
Human Pose and Action Recognition参考文献 100被引用数 15
ひとこと要約

本論文では、3次元人体ポーズ推定におけるシミュレーションから現実への転移を向上させるために、合成RGB画像の前処理として動きの特徴——特に光流および2次元キーポイントの軌道——を提案する。SURREALデータセットからの合成データを用いて、動きの特徴を含めた学習を実施した結果、3D Poses in the Wildベンチマークにおいて最先端の性能を達成し、学習中に実世界の3次元アノテーションを一切使用していないにもかかわらず、実データで学習されたモデルと同等の3次元メッシュ回復性能を達成した。

ABSTRACT

Simulation is an anonymous, low-bias source of data where annotation can often be done automatically; however, for some tasks, current models trained on synthetic data generalize poorly to real data. The task of 3D human pose estimation is a particularly interesting example of this sim2real problem, because learning-based approaches perform reasonably well given real training data, yet labeled 3D poses are extremely difficult to obtain in the wild, limiting scalability. In this paper, we show that standard neural-network approaches, which perform poorly when trained on synthetic RGB images, can perform well when the data is pre-processed to extract cues about the person's motion, notably as optical flow and the motion of 2D keypoints. Therefore, our results suggest that motion can be a simple way to bridge a sim2real gap when video is available. We evaluate on the 3D Poses in the Wild dataset, the most challenging modern standard of 3D pose estimation, where we show full 3D mesh recovery that is on par with state-of-the-art methods trained on real 3D sequences, despite training only on synthetic humans from the SURREAL dataset.

研究の動機と目的

  • 合成データで学習したモデルが実世界データで良好に動作しないという、3次元人体ポーズ推定におけるシミュレーションから現実への一般化ギャップを解消すること。
  • 監視学習アプローチのスケーラビリティを制限する実世界の3次元ラベル付き人体ポーズデータの不足を克服すること。
  • 動画から抽出した動きの特徴が、合成データと現実データの分布の間を橋渡しできるかどうかを調査すること。
  • 実世界の3次元アノテーションが一切不要な状況でも、合成RGBデータに動きの前処理を施すことで高精度な3次元メッシュ回復を実現すること。

提案手法

  • SURREALデータセットの合成RGB動画フレームを前処理し、光流および2次元キーポイントの軌道を動きの特徴として抽出する。
  • 動きを強化した合成データを、標準の3次元ポーズ推定ネットワークに供給し、動きの特徴を追加の入力チャネルとして扱う。
  • 実世界の3次元ポーズアノテーションを一切使用せず、合成データに動きの特徴を含めたものだけでモデルを学習する。
  • 標準の3次元メッシュ回帰ヘッドを用いて、動きを補強した入力から完全な3次元人体メッシュを予測する。
  • 動きの特徴の時間的整合性を活用し、実世界の動画シーケンスへの一般化を向上させる。
  • 3次元アノテーションが付与された非制約的で現実世界の動画シーケンスを含む、3D Poses in the Wildベンチマークでモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1動画から抽出した動きの特徴は、3次元ポーズ推定におけるシミュレーションから現実への転移を改善できるか?
  • RQ2光流および2次元キーポイントの動きを合成RGBデータに前処理することで、実世界データへの一般化が向上するか?
  • RQ3動きの特徴を含んだ合成データのみで学習したモデルは、実世界の3次元シーケンスで学習した最先端の手法と同等の性能を達成できるか?
  • RQ4実世界の3次元アノテーションが利用できない状況において、動きに基づく特徴工学がシミュレーションから現実へのギャップをどれほど効果的に埋められるか?

主な発見

  • 本手法は、実世界の3次元アノテーションを一切使用していないにもかかわらず、実データで学習した最先端の手法と同等の完全な3次元メッシュ回復性能を達成した。
  • 光流および2次元キーポイントの動きを前処理として用いることで、シミュレーションから実世界への一般化が顕著に向上した。
  • 生の合成RGB画像で学習した標準のニューラルネットワークとは異なり、本手法は実データへの一般化に成功した。
  • 動きの特徴は、合成データの分布を実世界の動画データの分布に一致させる強力なインダクティブバイアスとして機能した。
  • 非制約的かつ多様なポーズを含む、実世界の挑戦的なデータセット3D Poses in the Wildでも、競争力ある結果を達成した。
  • 本手法は、動きの情報が3次元人体ポーズ推定におけるシミュレーションから現実への課題に対して、単純ながらも極めて効果的な解決策であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。