Skip to main content
QUICK REVIEW

[論文レビュー] Dense Human Body Correspondences Using Convolutional Networks

Lingyu Wei, Qixing Huang|arXiv (Cornell University)|Nov 18, 2015
3D Shape Modeling and Analysis参考文献 46被引用数 13
ひとこと要約

本論文では、完全な密着幾何学的形状や一様な視点、全身スキャンを必要とせずに、部分的な深度マップや部分的な表面からも、3次元人体スキャン間の高密度でリアルタイムな対応関係を計算するための深層学習手法を提案する。境界近くの特徴埋め込みを滑らかに学習させることで、人体の部位分類を実行するネットワークを訓練し、複雑なポーズの衣装あり・なしの人間に対して、最先端の精度を達成した。従来の教師なし非剛性登録手法を上回った。

ABSTRACT

We propose a deep learning approach for finding dense correspondences between 3D scans of people. Our method requires only partial geometric information in the form of two depth maps or partial reconstructed surfaces, works for humans in arbitrary poses and wearing any clothing, does not require the two people to be scanned from similar viewpoints, and runs in real time. We use a deep convolutional neural network to train a feature descriptor on depth map pixels, but crucially, rather than training the network to solve the shape correspondence problem directly, we train it to solve a body region classification problem, modified to increase the smoothness of the learned descriptors near region boundaries. This approach ensures that nearby points on the human body are nearby in feature space, and vice versa, rendering the feature descriptor suitable for computing dense correspondences between the scans. We validate our method on real and synthetic data for both clothed and unclothed humans, and show that our correspondences are more robust than is possible with state-of-the-art unsupervised methods, and more accurate than those found using methods that require full watertight 3D geometry.

研究の動機と目的

  • 任意のポーズや衣装を有する3次元人体スキャン間で、高密度かつリアルタイムの対応関係を計算可能にする。特に、深度マップなどの不完全なデータからでも動作可能である。
  • 従来の教師なし手法が、大きな変形、遮蔽、衣装によるトポロジーの変化に対して失敗するという制限を克服する。
  • RGB-Dセンサーを用いた実世界のスキャン環境ではしばしば入手困難な、完全で密な3次元幾何学的形状に依存するのを最小限に抑える。
  • SCAPEデータベースの標準ポーズデータとYobi3DおよびMITデータセットの衣装あり被験者データを統合し、汎用性の高い学習フレームワークを構築する。
  • 訓練データの必要量を最小限に抑えつつ、人体部位境界付近での特徴記述子の滑らかさを向上させ、対応関係抽出における外れ値を低減する。

提案手法

  • AlexNetをベースに改造した深層畳み込みニューラルネットワークを、深度マップの画素から人体部位分類を予測するように訓練する。特に、部位境界付近での特徴の滑らかさを向上させることに注力する。
  • 3次元表面の繰り返しジオデシックセグメンテーションを実行し、特徴空間における滑らかな埋め込みを学習するようにネットワークをガイドする。
  • SCAPEデータベース(裸体被験者)とYobi3D・MITデータセット(衣装あり被験者)の3次元スキャンデータを統合し、頂点ごとのラベルを用いて、エンドツーエンドでネットワークを訓練する。
  • 複数の視点から深度マップをレンダリングし、訓練済みネットワークの各画素特徴を平均化することで、頂点ごとの特徴記述子を抽出する。
  • 学習済み特徴空間内で最近傍探索により高密度な対応関係を計算し、その後、標準の非剛性登録アルゴリズムを用いて精緻化する。
  • 完全な3次元モデル、部分的なスキャン、単一の深度マップに対しても動作可能であり、多様な入力タイプにわたりリアルタイム性能と頑健性を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、大きな変形や衣装の変化に対しても一貫性を保ち続ける、滑らかで特徴的な3次元人体スキャン用特徴記述子を学習できるか?
  • RQ2ニューラルネットワークは、人体部位境界付近ですら、表面における局所的な幾何的近接性を保つような特徴埋め込みを生成できるか?
  • RQ3統一されたネットワークアーキテクチャは、ポーズや入力の不完全さに起因する変動を伴う裸体・衣装あり被験者に、どの程度一般化できるか?
  • RQ4完全で密な3次元幾何学的形状や初期アライメントの整ったポーズを必要とせずに、高精度な高密度対応関係を達成できるか?
  • RQ5訓練時に繰り返しメッシュセグメンテーションを用いることで、必要なトレーニングサンプル数を著しく削減し、対応関係の頑健性を向上できるか?

主な発見

  • FAUSTデータセットを用いた評価で、被験者内ペアでは平均誤差2.00 cm、被験者間ペアでは2.35 cmを達成し、従来のすべての教師なし手法を上回り、Chenら[10]による最先端の非剛性登録手法と同等の性能を示した。
  • 非剛性精緻化(CNN-S)を施した後、被験者内ペアでは10cm再現率0.975、被験者間ペアでは0.972を達成し、RF(0.658) や BIM(0.615) といった手法を著しく上回った。
  • 1回のスキャンペアあたり1秒未塔で高密度対応関係を計算可能であり、リアルタイム性能を実現した。一方、従来の非剛性登録手法は著しく遅い。
  • マルチセグメンテーションに基づく訓練により、人体部位境界付近の特徴空間の外れ値が低減され、標準的な分類ネットワークに比べて頑健性が向上した。
  • 部分対部分および部分対完全形状のマッチングに対しても良好に一般化でき、一方の入力が完全なモデルでない場合でも正確な対応関係を実現した。
  • 繰り返しジオデシックセグメンテーションに基づく滑らかさ誘導型の訓練目的のおかげで、従来手法に比べて必要なトレーニングデータ量を削減できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。