Skip to main content
QUICK REVIEW

[論文レビュー] Playing for 3D Human Recovery

Zhongang Cai, Mingyuan Zhang|arXiv (Cornell University)|Oct 14, 2021
Human Pose and Action Recognition参考文献 63被引用数 17
ひとこと要約

本稿では、自動運転エージェントを用いて『Grand Theft Auto V』をプレイすることで生成された140万件の3次元人体シーケンスとSMPLパラメータを備えた大規模な合成データセット、GTA-Humanを紹介する。本研究では、GTA-Humanからの合成データが、特に野生の制約のない環境において、3次元人体ポーズおよび形状推定を顕著に向上させることを示しており、実データと組み合わせることで最先端の手法を上回っている。

ABSTRACT

Image- and video-based 3D human recovery (i.e., pose and shape estimation) have achieved substantial progress. However, due to the prohibitive cost of motion capture, existing datasets are often limited in scale and diversity. In this work, we obtain massive human sequences by playing the video game with automatically annotated 3D ground truths. Specifically, we contribute GTA-Human, a large-scale 3D human dataset generated with the GTA-V game engine, featuring a highly diverse set of subjects, actions, and scenarios. More importantly, we study the use of game-playing data and obtain five major insights. First, game-playing data is surprisingly effective. A simple frame-based baseline trained on GTA-Human outperforms more sophisticated methods by a large margin. For video-based methods, GTA-Human is even on par with the in-domain training set. Second, we discover that synthetic data provides critical complements to the real data that is typically collected indoor. Our investigation into domain gap provides explanations for our data mixture strategies that are simple yet useful. Third, the scale of the dataset matters. The performance boost is closely related to the additional data available. A systematic study reveals the model sensitivity to data density from multiple key aspects. Fourth, the effectiveness of GTA-Human is also attributed to the rich collection of strong supervision labels (SMPL parameters), which are otherwise expensive to acquire in real datasets. Fifth, the benefits of synthetic data extend to larger models such as deeper convolutional neural networks (CNNs) and Transformers, for which a significant impact is also observed. We hope our work could pave the way for scaling up 3D human recovery to the real world. Homepage: https://caizhongang.github.io/projects/GTA-Human/

研究の動機と目的

  • 3次元人体回復のための正確なSMPLアノテーションを備えた3次元人体データセットの不足と高コストを解決する。
  • 既存の実世界データセットの限界(小規模、屋内限定、パラメトリックな3次元監視情報の欠如)を克服する。
  • 合成されたゲーム生成データを用いた3次元人体推定モデルの向上の可能性と有効性を検証する。
  • ドメインギャップを低減し一般化性能を向上させるために、合成データと実データを組み合わせるデータミックス戦略を調査する。
  • 大規模な合成データに強力な監視(SMPLパラメータ)が与えられることで、実データと同等またはそれを上回る性能を示すことが、トランスフォーマーのような複雑なモデルに対しても確認できる。

提案手法

  • 多数の計算的エージェントを展開し、『Grand Theft Auto V』を自律的にプレイさせ、一貫した3次元人体アノテーションが付与された多様な動画シーケンスを収集する。
  • ゲームエンジンの内部3次元データパイプラインを用いて、ゲーム内に存在する各仮想人体のSMPLパラメータ(ポーズおよび形状)を自動で抽出する。
  • 被験者(600人以上)、行動(20,000種類)、場所(6カテゴリ)、カメラアングル、照明、天候を体系的に変化させ、多様性を最大化する。
  • GTA-Humanと実世界データセット(例:3DPW、MPI-INF-3DHP)を組み合わせたデータミックス戦略を構築し、トレーニングおよびファインチューニングに用いる。
  • HMR、SPIN、VIBE、PAREなどの複数のモデルを、実データと合成データの混合データでトレーニングおよび評価し、性能向上を評価する。
  • アブレーションスタディを用いて、データ密度、監視品質、バックボーンアーキテクチャ(CNNおよびトランスフォーマー)に対するモデル感受性を分析する。

実験結果

リサーチクエスチョン

  • RQ1合成されたゲーム生成データは、特に制約のない(野生の)環境において、3次元人体ポーズおよび形状推定を顕著に向上させることができるか?
  • RQ2実データでトレーニングされたより複雑な最先端手法と比較して、合成データでトレーニングされた単純なフレームベースベースラインの有効性はいかほどか?
  • RQ3合成データと実データを混合することで、多様な環境にわたるドメインギャップがどの程度低減され、一般化性能が向上するか?
  • RQ4データスケールおよびデータ密度は、3次元人体回復タスクにおけるモデル性能にどのように影響するか?
  • RQ5より深いモデル(例:トランスフォーマー)は、SMPLパラメータなどの強力な監視が与えられた大規模な合成データから、どの程度利益を得られるか?

主な発見

  • 3DPWなどの実世界ベンチマークで評価したところ、GTA-Humanでトレーニングされた単純なフレームベースベースラインが、3DPWで評価されたSPIN や VIBE といったより複雑な最先端手法を上回った。
  • 実データと合成データ(GTA-Human + 実データ)を混合してトレーニングすることで、ドメイン内実データでトレーニングした場合と同等の性能が達成され、強力なドメイン一般化能力が示された。
  • モデル性能はデータ密度に強く依存しており、性能向上は特に野生の環境において、追加データ量と強く相関していた。
  • GTA-Humanに含まれる豊富なSMPL監視(140万件のラベル付きシーケンス)は、このようなアノテーションが高コストである実データセットと比較して、顕著な優位性を提供している。
  • トランスフォーマーやより深いCNNといったより深いアーキテクチャも、GTA-Humanで事前学習することで顕著な性能向上を示し、合成データの恩恵がスケーラブルであることが確認された。
  • 被験者、行動、環境(屋外シーンを含む)の多様性により、モデルは実世界の野生のシナリオへの一般化能力が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。