Skip to main content
QUICK REVIEW

[論文レビュー] View Extrapolation of Human Body from a Single Image

Hao Zhu, Hao Su|arXiv (Cornell University)|Apr 11, 2018
Advanced Vision and Imaging参考文献 36被引用数 5
ひとこと要約

本稿では、1枚の画像から人体の新規視点合成を実現する幾何学的注意を意識した深層学習フレームワークを提案する。本手法は、形状推定と透視投影に基づくフロー予測にタスクを分解する。3D幾何構造を明示的にモデル化し、幾何制約を課した2段階のネットワークを用いることで、特に大きなポーズ変化や隠蔽を伴う可動部や変形しやすい人体に対して、エンドツーエンドのCNNと比較して顕著に高い精度を達成する。

ABSTRACT

We study how to synthesize novel views of human body from a single image. Though recent deep learning based methods work well for rigid objects, they often fail on objects with large articulation, like human bodies. The core step of existing methods is to fit a map from the observable views to novel views by CNNs; however, the rich articulation modes of human body make it rather challenging for CNNs to memorize and interpolate the data well. To address the problem, we propose a novel deep learning based pipeline that explicitly estimates and leverages the geometry of the underlying human body. Our new pipeline is a composition of a shape estimation network and an image generation network, and at the interface a perspective transformation is applied to generate a forward flow for pixel value transportation. Our design is able to factor out the space of data variation and makes learning at each step much easier. Empirically, we show that the performance for pose-varying objects can be improved dramatically. Our method can also be applied on real data captured by 3D sensors, and the flow generated by our methods can be used for generating high quality results in higher resolution.

研究の動機と目的

  • 高可動性で変形しやすい人体の新規視点合成を、1枚の画像から正確に実現する挑戦に応えること。
  • エンドツーエンドのCNNが、人体画像における大きなポーズ変化や隠蔽を扱う際の限界を克服すること。
  • 3D幾何構造を明示的にモデル化し、形状推定と画像生成を分離することで、視点合成の品質を向上させること。
  • 合成データ上で訓練されたモデルからのアップサンプリングされたフローを用いて、高解像度の合成を可能にすること。
  • 深度ネットワークのドメイン適応を用いて、実世界のRGB-Dデータに対して頑健性を示すこと。

提案手法

  • 本手法は2段階のパイプラインを用いる:まず、専用の形状推定ネットワークを用いて入力画像から深度マップ(形状)を推定する。
  • 次に、透視投影層が推定された深度マップから前方オプティカルフローを計算し、元の画像ピクセルをターゲット視点の位置に変換する。
  • 画像生成ネットワークは予測されたフローを用いて特徴をワープし、新規視点を合成する。画像損失とフローマッチング損失の両方で共同監督を受ける。
  • アーキテクチャは形状推定、フローパラメータ予測、画像生成を分離することで、各サブタスクの複雑さを低減する。
  • マルチタスク監督を用いて訓練する:画像再構成にはL1損失、フローの整合性にはフローマッチング損失を適用する。
  • 実世界データの処理では、Kinect2から得た8,000フレームのRGB-Dデータを用いて深度ネットワークをファインチューニングし、ドメインシフトに対処する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの深層学習と比較して、明示的な3D幾何構造モデリングが、高可動性人体の新規視点合成に効果をもたらすか?
  • RQ2形状推定をフローや画像生成から分離することで、一般化性能が向上し、合成画像のぼやけが軽減されるか?
  • RQ3幾何学的補助を施したCNNは、大きなポーズ変化や自己隠蔽を伴う状況でも、純粋に学習されたフローパラメータ予測を上回るか?
  • RQ4合成データから実世界のRGB-Dデータへの転移において、本手法はどの程度有効か?
  • RQ5予測されたフローを用いてアップサンプリングされたワープで高解像度の結果を生成できるか?

主な発見

  • 本手法は、幾何的監視なしに直接フローを予測するVSAPおよびVSAP+M.+F.と比較して、顕著に高いフローアクキュラシーを達成した。
  • 合成ベンチマークでは、MSEとSSIMの両面で最先端手法を上回り、特に「chair」カテゴリではMSEが7.2%低下し、「car」カテゴリではSSIMが1.5%向上した。
  • 微調整なしでも実世界データにおいてポーズ構造を維持しており、深度ネットワークのファインチューニングにより視覚的品質が顕著に向上した。
  • 高解像度の結果(500×500)では顔の細部がよく保たれ、ぼやけが軽減されており、アップサンプリングされたフローによるワープの有効性が示された。
  • 本手法は、大きなポーズ変化や自己隠蔽に対しても頑健であり、ベースライン手法と比較して四肢や頭部領域の結果がよりシャープに保たれた。
  • アブレーションスタディにより、CNN単体では正確なピixe単位の透視投影を学習できないことが確認され、明示的な幾何モデリングの必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。