Skip to main content
QUICK REVIEW

[論文レビュー] Delving Deep Into Hybrid Annotations for 3D Human Recovery in the Wild

Yu Rong, Ziwei Liu|arXiv (Cornell University)|Aug 18, 2019
Video Surveillance and Tracking Methods参考文献 26被引用数 5
ひとこと要約

この論文は、制約のない(野生の)環境における1枚の画像からの3D人体回復において、ハイブリッドアノテーションの有効性を調査し、高密度対応(例:DensePoseからのIUVマップ)が、高価な野生の3Dアノテーションの代替として非常に効果的で低コストであると提案している。著者らは、高密度対応を用いて訓練されたモデルが、完全なペaired 3Dデータで訓練されたモデルの92%の性能を達成することを示しており、現実世界の3D人体再構築における強力で効率的な教師信号であると結論づけている。

ABSTRACT

Though much progress has been achieved in single-image 3D human recovery, estimating 3D model for in-the-wild images remains a formidable challenge. The reason lies in the fact that obtaining high-quality 3D annotations for in-the-wild images is an extremely hard task that consumes enormous amount of resources and manpower. To tackle this problem, previous methods adopt a hybrid training strategy that exploits multiple heterogeneous types of annotations including 3D and 2D while leaving the efficacy of each annotation not thoroughly investigated. In this work, we aim to perform a comprehensive study on cost and effectiveness trade-off between different annotations. Specifically, we focus on the challenging task of in-the-wild 3D human recovery from single images when paired 3D annotations are not fully available. Through extensive experiments, we obtain several observations: 1) 3D annotations are efficient, whereas traditional 2D annotations such as 2D keypoints and body part segmentation are less competent in guiding 3D human recovery. 2) Dense Correspondence such as DensePose is effective. When there are no paired in-the-wild 3D annotations available, the model exploiting dense correspondence can achieve 92% of the performance compared to a model trained with paired 3D data. We show that incorporating dense correspondence into in-the-wild 3D human recovery is promising and competitive due to its high efficiency and relatively low annotating cost. Our model trained with dense correspondence can serve as a strong reference for future research.

研究の動機と目的

  • 野生の3D人体回復のための深層ネットワークを訓練する際の、さまざまなアノテーションタイプのコストパフォーマンスのトレードオフを体系的に評価すること。
  • ペアドされた野生の3Dアノテーションが不足または利用できない状況において、高密度対応がその代替として実用的であるかを調査すること。
  • 特に高密度対応を含むハイブリッドアノテーションで訓練されたモデルの性能を、最先端の手法と比較してベンチマークすること。
  • 今後の野生の3D人体再構築分野における研究のための統一的でシンプルなベースラインフレームワークを確立すること。

提案手法

  • 著者らは、RGB画像とIUVマップ(高密度対応)を入力として受け取り、SMPLパラメータを予測する2本のエンコーダーを持つネットワークを用いる。
  • ペアドされた野生の3Dデータ、制約付き3Dデータ(例:Human3.6M)、2Dキーポイント、ボディパーツセグメンテーション、IUVマップといった、さまざまなアノテーションの組み合わせを用いてモデルを訓練する。
  • 重要な要素として、IUVマップからのノイズの多い予測を除去し、信頼性の高い高密度キーポイントを生成するためのリファインメントステップを導入している。
  • 頂点ごとの誤差(PVE)と高密度キーポイント距離(DKD)を最小化する損失関数を用いて、モデルをエンドツーエンドで訓練する。
  • 異なるアノテーションタイプの性能を、教師信号および入力特徴としての両方の観点から比較する実験を実施している。
  • 標準的な指標(DKDおよびPVE)を用いて、COCO-DensePose、UP-3D、3DPWのデータセット上でフレームワークを評価している。

実験結果

リサーチクエスチョン

  • RQ1ペアドされた野生の3Dアノテーションが利用できない状況において、高密度対応(例:IUVマップ)が、野生の3D人体回復の教師信号としてどれほど有効であるか?
  • RQ2ペアドされた野生の3Dアノテーションの20%のみを用いた場合、完全な教師信号と比較して性能はどの程度低下するか?
  • RQ32Dキーポイントのスパarselyなアノテーションとボディパーツセグメンテーションは、制約のない環境下で3Dモデル回復をどのように導くか?
  • RQ4高密度対応は、単なる教師信号を超えて、一般化性能の向上に寄与する強力な入力モodalitiyとして機能できるか?
  • RQ5本手法は、再構築精度の観点から、最先端のアプローチと比較してどの程度の性能を示すか?

主な発見

  • ペアドされた野生の3Dアノテーションで訓練されたモデルが最も高い性能を示したが、その80%を除外しても再構築誤差はわずかに5%増加した。
  • ペアドされた野生の3Dアノテーションが完全に利用できない状況では、高密度対応を教師信号として用いたモデルは、完全なペアド3Dデータで訓練されたモデルの92%の性能を達成した。
  • 3Dアノテーションが利用できない状況で、スパース2Dキーポイントのみを教師信号として用いた場合、モデルの性能は60%低下した。
  • 高密度ラベル(例:ボディパーツセグメンテーション)を入力として用いることで、性能向上はわずかであり、主たる教師信号としては不十分である。
  • 高密度対応を組み込むことで、性能が2.9%向上し、ペアド3Dデータの20%のみで訓練されたモデルが、完全な3Dデータで訓練されたモデルと同等の性能を達成した。
  • UP-3Dデータセットでは、高密度対応のみで訓練されたモデルがPVE 137.5 mmを達成し、ペアド3Dアノテーションを用いて訓練された最先端の手法と同等の性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。