Skip to main content
QUICK REVIEW

[論文レビュー] Canonical 3D Deformer Maps: Unifying parametric and non-parametric methods for dense weakly-supervised category reconstruction

David Novotný, Роман Шаповалов|arXiv (Cornell University)|Aug 28, 2020
Advanced Vision and Imaging参考文献 72被引用数 4
ひとこと要約

本論文は、2D画像からの密度的で弱教師付きのカテゴリーレベル再構成を実現するため、パラメトリックおよびノンパラメトリック手法を統合する新しい3D形状表現である正準3D変形マップ(C3DM)を提案する。各ピクセルごとに正準埋め込みを学習し、変形演算子と関連付けることで、密度的な対応関係を維持した単一視点3D再構成を可能にし、3Dアノテーションを一切用いずに顔、鳥、車の分類において最先端の性能を達成する。

ABSTRACT

We propose the Canonical 3D Deformer Map, a new representation of the 3D shape of common object categories that can be learned from a collection of 2D images of independent objects. Our method builds in a novel way on concepts from parametric deformation models, non-parametric 3D reconstruction, and canonical embeddings, combining their individual advantages. In particular, it learns to associate each image pixel with a deformation model of the corresponding 3D object point which is canonical, i.e. intrinsic to the identity of the point and shared across objects of the category. The result is a method that, given only sparse 2D supervision at training time, can, at test time, reconstruct the 3D shape and texture of objects from single views, while establishing meaningful dense correspondences between object instances. It also achieves state-of-the-art results in dense 3D reconstruction on public in-the-wild datasets of faces, cars, and birds.

研究の動機と目的

  • 3Dアノテーションが存在しない単一の2D画像からオブジェクトカテゴリの3D形状を再構成する課題に対処すること。
  • 正準埋め込みを導入することで、パラメトリック変形モデルとノンパラメトリック深度推定を統合し、密度的な対応関係を保持すること。
  • トレーニング段階でスパarsely 2Dの監督信号のみを用いて、密度的かつカテゴリーレベルの3D再構成を可能にすること。
  • ポーズや外観の変化にかかわらず、幾何学的整合性を保ちながら、単一視点から現実的で正確な3D形状とテクスチャ再構成を実現すること。

提案手法

  • C3DMは、各画像ピクセル y に対して正準埋め込み Φy(I) = κ を学習し、対応する3Dオブジェクト点の内在的座標 κ にマッピングする。
  • 変形演算子 Bκ(α) を用いて、正準座標 κ と全般的な変形パラメータ α の関数として3D点 Xy を再構成する。
  • ノンパラメトリックな正準マッピングとパラメトリックな変形モデルを組み合わせることで、オブジェクトインスタンス間で共有可能な表現を可能にする。
  • ニューラルネットワークが正準座標から変形演算子へのマッピングを学習し、柔軟かつ微分可能な3D再構成を実現する。
  • 再投影誤差、知覚的誤差、埋め込み整合性、マスク、テクスチャの損失からなるマルチコンponent損失を用いてトレーニングし、幾何学的・外観的忠実度を確保する。
  • 正準埋め込み Φy(IB) を介して、ソース画像 IA の外観記述子 β(IA) をターゲット画像 IB に転送することで、テクスチャ転送を可能にする。

実験結果

リサーチクエスチョン

  • RQ1弱教師付き条件下で、パラメトリックおよびノンパラメトリック3D再構成の利点を統合した統一表現を学習可能か?
  • RQ23Dアノテーションが存在しない状況でも、オブジェクトインスタンス間で密度的な対応関係を確立できるか?
  • RQ3正準埋め込みにより、スパarsely 2Dの監督信号のみを用いて正確な3D再構成が可能か?
  • RQ4顔、鳥、車のようにアーティキュレーションや外観が異なる多様なオブジェクトカテゴリに、C3DMはどの程度一般化可能か?

主な発見

  • C3DMは、顔、鳥、車の分類において、公開の野外データセットで密度的3D再構成の最先端性能を達成した。
  • 遮蔽やセグメンテーション誤差が存在しても、正確な幾何学的形状と現実的なテクスチャを再構成できる。
  • オブジェクトインスタンス間で意味的な密度的対応関係を確立し、ポーズや外観の変化にかかわらず一貫した3D形状モデリングを可能にした。
  • 実験結果から、インスタンスレベルの変化に対して頑健であり、テクスチャ転送時においても幾何学的整合性を維持していることが示された。
  • 全評価カテゴリで、最先端のCMR手法を3D再構成精度および視覚的リアリズムの両面で上回った。
  • 正準埋め込みの使用により、3D形状を保持したまま外観の効果的転送が可能であることが、テクスチャ転送実験で裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。