Skip to main content
QUICK REVIEW

[論文レビュー] TetraTSDF: 3D human reconstruction from a single image with a tetrahedral outer shell

Hayato Onizuka, Zehra Hayirci|arXiv (Cornell University)|Apr 22, 2020
3D Shape Modeling and Analysis参考文献 43被引用数 5
ひとこと要約

本稿では、人間特有の外殻に埋め込まれた四面体TSDF(切り詰め符号付き距離関数)を用いたコン pact かつ密な3次元人体表現、TetraTSDFを提案する。この手法により、単一のRGB画像からの高分解能3次元再構築が可能となる。本手法はCNNを用いたエンドツーエンド回帰を実現する新規なパーツ接続ネットワーク(PCN)を採用し、たるんだ衣服、指、靴などの細部の再構築において最先端の精度を達成している。定量的・定性的な評価において、平均チェンバーディスタンスが約0.5 cmという優れた性能を示しており、先行手法を上回っている。

ABSTRACT

Recovering the 3D shape of a person from its 2D appearance is ill-posed due to ambiguities. Nevertheless, with the help of convolutional neural networks (CNN) and prior knowledge on the 3D human body, it is possible to overcome such ambiguities to recover detailed 3D shapes of human bodies from single images. Current solutions, however, fail to reconstruct all the details of a person wearing loose clothes. This is because of either (a) huge memory requirement that cannot be maintained even on modern GPUs or (b) the compact 3D representation that cannot encode all the details. In this paper, we propose the tetrahedral outer shell volumetric truncated signed distance function (TetraTSDF) model for the human body, and its corresponding part connection network (PCN) for 3D human body shape regression. Our proposed model is compact, dense, accurate, and yet well suited for CNN-based regression task. Our proposed PCN allows us to learn the distribution of the TSDF in the tetrahedral volume from a single image in an end-to-end manner. Results show that our proposed method allows to reconstruct detailed shapes of humans wearing loose clothes from single RGB images.

研究の動機と目的

  • 単一のRGB画像からの詳細な3次元人体形状の再構築、特にたるんだ衣服を着用した場合の課題に対処すること。
  • CNNベースの回帰における従来のボリュメトリックTSDF表現のメモリおよび解像度制限を克服すること。
  • 深層学習に適した、コンパクトで密な、かつ高精度な3次元表現を構築すること。
  • CNNとパーツ接続ネットワーク(PCN)を組み合わせた新規なアーキテクチャを用いて、単一の画像から3次元形状をエンドツーエンドで学習すること。
  • 手や足、衣服のたるみなど、非凸領域および遮蔽領域の再構築精度を向上させること。

提案手法

  • 粗いSMPLモデルから構築された四面体外殻を提案し、TSDFフィールドの幾何的スケルトンとして機能させる。
  • 外殻の頂点に位置する四面体ボリュメトリックグリッドを構築し、切り詰め符号付き距離関数(TSDF)フィールドを埋め込むことで、密でコンパクトな3次元表現を実現する。
  • 四面体頂点間の局所的な幾何的関係をモデル化するパーツ接続ネットワーク(PCN)を導入し、特徴学習の向上と回帰精度の向上を図る。
  • 単一のRGB画像からTSDFフィールドを直接回帰するエンドツーエンドのCNN-PCNアワークラスネットワークを設計する。
  • 訓練用に高品質なTSDFフィールドを生成するために、真値の3次元スキャンを用いることで、正確な監視を確保する。
  • 訓練中に外殻およびTSDFフィールドを最適化するための微分可能なレンダリングおよび最適化パイプラインを採用する。

実験結果

リサーチクエスチョン

  • RQ1四面体ベースのTSDF表現は、メモリ効率を維持したまま、単一のRGB画像からの高解像度3次元人体再構築を達成できるか?
  • RQ2PCNベースのアーキテクチャは、四面体グリッドにおける局所的な幾何的依存関係を効果的にモデル化でき、CNN特徴からの3次元形状回帰を向上させられるか?
  • RQ3提案手法は、指、靴、衣服のしわといった細部の再構築において、既存の最先端手法を上回る性能を示すか?
  • RQ4本手法は、手や足の遮蔽領域や非凸領域を、たるんだ衣服においても適切に処理できるか?
  • RQ5補正マップや標準ボクセルグリッドと比較して、コンパクトな四面体表現は形状の細部をどの程度保持できるか?

主な発見

  • 提案手法は、Articulatedデータセットにおいて平均チェンバーディスタンス約0.5 cmを達成し、BodyNet や Tex2Shape などの既存手法を上回った。
  • 定性的な結果から、手の正しいポーズを事前に知らなくても、正しいポーズの指や足元の靴の再構築が顕著に優れていた。
  • 本手法は、補正マッピングや低解像度ボクセル表現でしばしば失われる遮蔽領域や複雑な衣服のしわの再構築に成功した。
  • PCNベースのネットワークは収束性と精度が向上し、接続数に依存する性能の変動が示され、メモリと精度のトレードオフが確認された。
  • 四面体TSDF表現により、従来手法よりも高解像度の再構築が可能でありながら、メモリ効率を維持し、GPUメモリオーバーフローの問題を回避した。
  • アブレーションスタディにより、PCNはベースラインアーキテクチャと比較して、特徴学習および形状の細部回復を顕著に向上させたことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。