Skip to main content
QUICK REVIEW

[論文レビュー] Shape-from-Mask: A Deep Learning Based Human Body Shape Reconstruction from Binary Mask Images

Zhongping Ji, Qi Xiao|arXiv (Cornell University)|Jun 22, 2018
3D Shape Modeling and Analysis参考文献 32被引用数 9
ひとこと要約

本論文では、2本のCNNリgressョンネットワークを用いて、二値の正射影マスク画像から正確な3次元人体形状を再構築する深層学習手法、Shape-from-Maskを提案する。前方および側面の特徴を分離し、融合させることで、色画像やアノテートされたキーポイントを必要とせず、高精細な再構築を実現する。この手法により、VR、ゲーム、ファッション分野における高速なデジタルアバター作成が可能になる。

ABSTRACT

3D content creation is referred to as one of the most fundamental tasks of computer graphics. And many 3D modeling algorithms from 2D images or curves have been developed over the past several decades. Designers are allowed to align some conceptual images or sketch some suggestive curves, from front, side, and top views, and then use them as references in constructing a 3D model automatically or manually. However, to the best of our knowledge, no studies have investigated on 3D human body reconstruction in a similar manner. In this paper, we propose a deep learning based reconstruction of 3D human body shape from 2D orthographic views. A novel CNN-based regression network, with two branches corresponding to frontal and lateral views respectively, is designed for estimating 3D human body shape from 2D mask images. We train our networks separately to decouple the feature descriptors which encode the body parameters from different views, and fuse them to estimate an accurate human body shape. In addition, to overcome the shortage of training data required for this purpose, we propose some significantly data augmentation schemes for 3D human body shapes, which can be used to promote further research on this topic. Extensive experimen- tal results demonstrate that visually realistic and accurate reconstructions can be achieved effectively using our algorithm. Requiring only binary mask images, our method can help users create their own digital avatars quickly, and also make it easy to create digital human body for 3D game, virtual reality, online fashion shopping.

研究の動機と目的

  • 色画像に含まれる衣服に起因するプライバシー問題や幾何的曖昧さを回避しつつ、2次元の二値マスク画像から正確な3次元人体形状を再構築する課題に対処すること。
  • 限られた実世界の訓練データを用いて、多様な人体形状に一般化可能なデータ効率の良い深層学習フレームワークを開発すること。
  • 2次元のアノテーション(キーポイントラベルやセグメンテーションなど)を一切必要としない、前方および側面の二値正射影マスクのみを入力として、自動的に3次元人体モデリングを実現すること。
  • 深層ネットワークの訓練におけるデータ不足を克服するため、3次元人体形状のための新規なデータ拡張技術を提案すること。
  • インタラクティブまたは高精細モデリングパイプラインにおける微調整の初期化として適した、実存的でトポロジーが一貫した3次元メッシュを生成すること。

提案手法

  • 前方マスクと側面マスクを別々に処理する2本のCNNブランチを設計し、各視点に特化した特徴を独立して抽出する。
  • 各視点からのボディパラメータ用特徴記述子を分離することで、別々の学習が可能となり、視点間の干渉を低減する。
  • 両ブランチからの特徴を共有リグレッションヘッドを介して統合し、分離されたボディ形状空間における3次元ボディ形状パラメータを予測する。
  • 既存の形状をボディパラメータ空間で摂動させることで、実際のアノテーションを一切必要とせず、合成された3次元人体形状を生成する新規なデータ拡張パイプラインを提案する。この手法により、訓練データが大幅に拡張される。
  • RGBデータや2次元キーポイントアノテーションに依存しないように、直接二値マスク入力から3次元ボディ形状パラメータを回帰するようにモデルを学習する。
  • 後処理として、生成された3次元メッシュからジオメトリに学習されたジョイントレグレッサーを用いてスケルトンを抽出し、アニメーションなどの後続応用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1色画像や2次元アノテーションに依存せずに、二値の正射影マスク画像からのみ3次元人体形状を正確に再構築できるか?
  • RQ22本のCNNアーキテクチャが、前方および側面の視点から分離されたボディ形状表現を学習するのにどの程度効果的か?
  • RQ33次元人体形状のデータ拡張が、データが限られた状況下での一般化性能向上にどの程度寄与するか?
  • RQ4予測された3次元メッシュは、2次元マスクからの学習のみで、スケルトン推定やメッシュ編集などの後続タスクをサポートできるか?
  • RQ5不完全またはノイズのあるマスク入力に対しても、本手法はどれほど頑健であり、欠損領域を学習済みの形状事前知識に基づいて補完できるか?

主な発見

  • 本手法は、RGBデータや2次元アノテーションを一切必要とせず、二値マスク入力のみで視覚的に現実的かつ幾何学的に正確な3次元人体再構築を達成した。
  • 2本のCNNアーキテクチャにより、前方および側面の視点からの特徴を効果的に分離・統合でき、単一視点ベースラインに比べて形状推定性能が向上した。
  • データ拡張戦略により、実世界の3次元人体データが限られている状況下でも、モデルの一般化性能が顕著に向上した。
  • 生成された3次元メッシュは、関節が解剖学的ランドマークに正しく位置づけられるほど、正確なスケルトン抽出を可能にした。これは、モデルが意味のあるボディジオメトリを学習できていることを裏付けた。
  • 不完全または部分的にマスクされた入力に対しても、本手法は妥当な形状を再構築でき、ネットワークが学習済みの形状事前知識に基づいて欠損領域を補完できることが示された。
  • 再構築された3次元モデルは、形状から明るさを推定する手法やディスplaceメントマッピング技術による細部の追加といった、さらなる微調整のための強力な初期化として機能した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。