Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Learning of Probably Symmetric Deformable 3D Objects from Images in the Wild

Shangzhe Wu, Christian Rupprecht|arXiv (Cornell University)|Nov 25, 2019
Advanced Vision and Imaging参考文献 71被引用数 14
ひとこと要約

本稿では、確率的対称性と照明モデリングを活用して、教師なしの深層オートエンコーダーを提案し、単一視点画像を深度、アルベド、視点、照明に分離する。2D/3Dの教師データや事前形状モデルを一切使用しないにもかかわらず、顔、ネコ、自動車において最先端の3D再構成忠実度を達成し、2Dキーポintsの教師情報を用いる手法を上回る性能を発揮する。

ABSTRACT

We propose a method to learn 3D deformable object categories from raw single-view images, without external supervision. The method is based on an autoencoder that factors each input image into depth, albedo, viewpoint and illumination. In order to disentangle these components without supervision, we use the fact that many object categories have, at least in principle, a symmetric structure. We show that reasoning about illumination allows us to exploit the underlying object symmetry even if the appearance is not symmetric due to shading. Furthermore, we model objects that are probably, but not certainly, symmetric by predicting a symmetry probability map, learned end-to-end with the other components of the model. Our experiments show that this method can recover very accurately the 3D shape of human faces, cat faces and cars from single-view images, without any supervision or a prior shape model. On benchmarks, we demonstrate superior accuracy compared to another method that uses supervision at the level of 2D image correspondences.

研究の動機と目的

  • 2D や 3D の教師データを一切使用せずに、制約のない単一視点画像から可動物体のカテゴリを学習すること。
  • 幾何的事前知識を用いて、深度、アルベド、視点、照明といった画像要因を教師なしで分離すること。
  • 学習された対称性確率マップを用いて、厳密な対称性ではなく「おそらく対称である」という対称性をモデル化すること。
  • 非対称な照明や外観に対しても、対称性を活用することで3D再構成忠実度を向上させること。
  • 微調整なしに、現実世界の画像や非写実的画像(例:絵画、コマーシャル)へ一般化できること。

提案手法

  • 本手法は、教師なしで入力画像を深度、アルベド、視点、照明成分に分解するオートエンコーダーを用いる。
  • 各画素が対称な対応画素を持つ確率を予測する対称性確率マップを導入し、エンド・ツー・エンドで学習する。
  • 照明を明示的にモデリングすることで、外観が非対称であっても対称性を活用できる。
  • 訓練中に特徴量の反転を用いて対称性を強制し、対称構造に関する確率的推論を可能にする。
  • 教師付き3Dデータやキーポイントアノテーションが一切不要で、原始的なRGB画像のみを用いて再構成損失に基づいて学習する。
  • 凸型の物体(例:顔)に適した、3D形状を深さマップとして表現する基準視点を用いる。

実験結果

リサーチクエスチョン

  • RQ12D や 3D の教師データなしで、単一視点画像から3D形状、アルベド、視点、照明を分離できるか?
  • RQ2現実世界のデータでは完全な対称性が欠ける中で、対称性を幾何的事前知識としてどのように活用できるか?
  • RQ3照明モデリングにより、照明による非対称な外観に対しても3D再構成忠実度を向上させられるか?
  • RQ4学習された対称性確率マップは、非対称で可動する物体の再構成忠実度を向上させるか?
  • RQ5微調整なしに、ドローイングや絵画などの非写実的画像へ一般化できるか?

主な発見

  • 本手法は、2D/3Dの教師データを欠如させる[49]や[56]といった教師なしベースラインと比較して、顔、ネコの顔、自動車において優れた3D再構成品質を達成した。
  • 3DFAWベンチマークでは、2Dキーポイントの教師情報を用いるDepthNet手法を上回り、微調整なしにほぼ教師あり性能に近い結果を得た。
  • 顔の絵画やコマーシャルのドローイングなど、非自然な画像に対しても微調整なしに一般化でき、ドメインシフトに対する頑健性を示した。
  • 合成顔に対するアブレーションスタディにより、対称性と照明モデリングが再構成精度を顕著に向上させることを確認した。
  • 極端な照明、非ラムベールト面、極端なポーズの状況では失敗が生じ、ラムベールト照明仮定が破綻する。
  • 顔の微細なディテールを高忠実度で再構成でき、定性的な比較でも先行する教師なし手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。