Skip to main content
QUICK REVIEW

[論文レビュー] Multiview Aggregation for Learning Category-Specific Shape Reconstruction

Srinath Sridhar, Davis Rempe|arXiv (Cornell University)|Jul 1, 2019
3D Shape Modeling and Analysis参考文献 43被引用数 14
ひとこと要約

本稿では、可変な数のRGBビューから可視面および隠れた(遮蔽された)表面を符号化する新しい3次元形状表現X-NOCSマップを提案する。置換に不変な2次元畳み込みニューラルネットワーク(CNN)を用い、マルチビュー特徴を統合し、効率的な結合演算を実行することで、高密度でカテゴリ特異的な形状を再構築し、より多くのビューが利用可能になるにつれて性能が向上する最先端の性能を達成する。

ABSTRACT

We investigate the problem of learning category-specific 3D shape reconstruction from a variable number of RGB views of previously unobserved object instances. Most approaches for multiview shape reconstruction operate on sparse shape representations, or assume a fixed number of views. We present a method that can estimate dense 3D shape, and aggregate shape across multiple and varying number of input views. Given a single input view of an object instance, we propose a representation that encodes the dense shape of the visible object surface as well as the surface behind line of sight occluded by the visible surface. When multiple input views are available, the shape representation is designed to be aggregated into a single 3D shape using an inexpensive union operation. We train a 2D CNN to learn to predict this representation from a variable number of views (1 or more). We further aggregate multiview information by using permutation equivariant layers that promote order-agnostic view information exchange at the feature level. Experiments show that our approach is able to produce dense 3D reconstructions of objects that improve in quality as more views are added.

研究の動機と目的

  • 可変な数のRGBビュー(遮蔽領域を含む)からカテゴリ特異的な3次元形状再構築を学習する課題に対処すること。
  • マルチビュー統合と互換性を持つ形で、可視面および隠れた(遮蔽された)表面幾何を符号化する形状表現を設計すること。
  • 順序に依存しないマルチビュー特徴統合を可能にする置換に不変な層を用いて、再構築品質を向上させること。
  • 固定されたビュー数を必要とせず、追加のビューが増えるにつれて忠実度が向上する高密度3次元形状再構築を実現すること。
  • ShapeNetのカテゴリにおいて、単一およびマルチビュー再構築ベンチマークで既存手法を上回ること。

提案手法

  • NOCSマップの拡張としてX-NOCSマップを提案し、各ピクセルに対してカメラ視点からの最も遠い表面点を符号化することで、遮蔽された幾何を捉える。
  • SegNetに基づく2次元畳み込みニューラルネットワーク(エンコーダ・デコーダ)を用い、1枚のRGB画像からNOCSおよびX-NOCSマップを予測し、ピクセルと3次元対応を保持する。
  • 異なるビューから予測されたNOCSおよびX-NOCSマップを複数回にわたって結合演算することで、完全な3次元形状推定を形成する。
  • ビュー順序に依存しないマルチビュー特徴統合を可能にするために、置換に不変な層を導入し、情報交換の強化を図る。
  • テスト時に任意の数のビューで推論が可能なように、可変な数のビューでモデルをエンドツーエンドに訓練する。
  • 正規化されたNOCS空間におけるカメラポーズ推定にDLTを用い、複数のビュー間で一貫した3次元形状のアライメントを実現する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、可変な数のRGBビューから、未学習の物体インスタンスの高密度3次元形状を正確に再構築できるか?
  • RQ21つの表現が、マルチビュー統合を支援する形で、可視面および隠れた表面幾何をどのように符号化できるか?
  • RQ3置換に不変な特徴統合は、個別に処理するのと比較して、マルチビュー3次元形状再構築にどの程度向上効果をもたらすか?
  • RQ4入力ビュー数が増えるにつれて再構築品質が向上するか?また、テスト時に異なるビュー数に一般化できるか?
  • RQ5提案されたX-NOCS表現は、既存の3次元再構築手法と比較して、正確性および詳細の保持の面でどの程度優れているか?

主な発見

  • 提案手法は、自動車、飛行機、いすの単一ビュー再構築で最先端の性能を達成し、それぞれのチェンファーディスタンスは0.1569、0.1855、0.3803であり、DPCを上回る。
  • 5つのビューを用いた場合、いすの再構築でチェンファーディスタンスを0.1576まで低下させ、同じ条件下で3D-R2N2の0.1932を顕著に上回る。
  • 追加のビューが増えるにつれて再構築品質が一貫して向上し、マルチビュー統合の有効性が裏付けられる。
  • 定性的な結果から、本手法はアームレストや複雑な輪郭といった細部を捉えているのに対し、3D-R2N2は5つのビューを使っても再構築に失敗している。
  • 置換に不変なネットワークにより、入力ビューの順序に関係なく安定した性能を発揮し、順序に依存しない特徴統合の成功が確認された。
  • X-NOCS表現により、可視面および隠れた表面幾何の両方を正確に予測でき、ベースラインのNOCSマップに比べて形状補完性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。