Skip to main content
QUICK REVIEW

[論文レビュー] HUMBI: A Large Multiview Dataset of Human Body Expressions

Zhixuan Yu, Jae Shin Yoon|arXiv (Cornell University)|Dec 1, 2018
Human Pose and Action Recognition参考文献 79被引用数 5
ひとこと要約

HUMBI は、自然な衣装を着た 772 名の多様な被験者を、107 台の同期化された HD カメラで捉えた大規模なマルチビュー・データセットであり、高精細な 3D メッシュ再構築とビュー別外観モデリングを可能にします。3D 姿勢およびメッシュ予測性能が顕著に向上し、既存のデータセットと補完的であり、一般化性能において優れ、写真同等のリアルなトランスミッション(telepresence)モデリングを可能にします。

ABSTRACT

This paper presents a new large multiview dataset called HUMBI for human body expressions with natural clothing. The goal of HUMBI is to facilitate modeling view-specific appearance and geometry of gaze, face, hand, body, and garment from assorted people. 107 synchronized HD cameras are used to capture 772 distinctive subjects across gender, ethnicity, age, and physical condition. With the multiview image streams, we reconstruct high fidelity body expressions using 3D mesh models, which allows representing view-specific appearance using their canonical atlas. We demonstrate that HUMBI is highly effective in learning and reconstructing a complete human model and is complementary to the existing datasets of human body expressions with limited views and subjects such as MPII-Gaze, Multi-PIE, Human3.6M, and Panoptic Studio datasets.

研究の動機と目的

  • 人間の身体表現のビュー別外観およびジオメトリをモデリングするための、大規模で多様性に富み、高解像度のマルチビュー・データセットの不足を解消すること。
  • 被験者、ポーズ、視点の広範な変動を捉えることで、一般化可能な写真同等のリアルな人間の身体モデルの学習を可能にすること。
  • 密度の高いマルチビュー・データを用いて、3D 人間身体再構築および認識モデルの改善のためのベンチマークを提供すること。
  • 注視、顔、手、身体、衣類の高精細モデリングを通じて、本物に近いトランスミッションシステムの開発を支援すること。

提案手法

  • 107 台の同期化された HD カメラ(うち 68 台が前面を向いたもの)を用いて、性別、人種、年齢、身体的状態にわたる 772 名の被験者を撮影。
  • 3D メッシュモデルを用いて高精細な 3D 身体表現を再構築し、標準化アトラスマッピングを用いてビュー別外観を表現。
  • マルチビュー・ステレオおよびシルエットからの形状技術を活用し、身体および衣類ジオメトリの高密度 3D 再構築を実現。
  • MPII の 2D ランドマークからの弱い教師信号を用いて、vanilla CNN を用いてビュー不変な 3D 姿勢を学習。
  • Human3.6M、MPI-INF-3DHP、UP-3D などの既存データセットと比較するためのクロスデータセット評価を実施。
  • カメラ数の影響を評価するためのカメラアブレーションスタディを実施し、衣類再構築の正確性および密度に与える影響を分析。

実験結果

リサーチクエスチョン

  • RQ1多様な被験者と高密度のカメラを備えた大規模なマルチビュー・データセットは、既存のデータセットと比較して、3D 人間身体ポーズ推定にどのように寄与するか?
  • RQ2HUMBI は、他のデータセットで学習された 3D ボディメッシュ予測モデルの一般化性能をどの程度向上させることができるか?
  • RQ3マルチビュー設定における正確な衣類再構築に最適なカメラ数は何か?
  • RQ43D 手および身体メッシュ予測のクロスデータ評価において、HUMBI は既存のデータセットと比較してどの程度の性能を示すか?
  • RQ5HUMBI は、限られた視点または限られた被験者数のデータセットで学習されたモデルの改善に補完的データソースとして機能できるか?

主な発見

  • HUMBI は Human3.6M や MPI-INF-3DHP よりも 3D ボディキーポイント予測で優れた性能を示し、それぞれ AUC(PCK曲線下の面積)が 0.023 および 0.064 高い。
  • HUMBI のみで学習したモデルは、他のデータセットと組み合わせた場合、それぞれ Human3.6M と MPI-INF-3DHP に対して AUC が 0.057 および 0.078 だけ向上。
  • HUMBI で学習した後、ObMan でテストした際の平均 3D 手メッシュ予測誤差は 3.5 ± 2.4 ピxls まで低下し、優れた一般化性能を示した。
  • 衣類再構築は、60 台のカメラでさえも、107 台のカメラに近い性能を達成するほどの高い正確性と密度を実現。
  • HUMBI を用いることで、モノクローラル 3D ボディメッシュ予測の性能が顕著に向上し、特に UP-3D と組み合わせた場合、平均誤差を 22.7 から 12.5 ピxls まで低減。
  • 既存のベンチマークと強い補完性を示しており、HUMBI を他のデータセットと組み合わせることで、単一データセットを用いる場合よりも一貫して優れた結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。