Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Occupancy Networks

Songyou Peng, Michael Niemeyer|arXiv (Cornell University)|Mar 10, 2020
3D Shape Modeling and Analysis参考文献 57被引用数 13
ひとこと要約

この論文では、3次元畳み込みと暗黙的占有デコーダーを組み合わせた新しい暗黙的3次元再構成手法、Convolutional Occupancy Networksを提案する。この手法により、スケーラブルで並進不変性を有し、複雑な物体や大規模な屋内シーンの高分解能再構成が可能になる。3次元畳み込みと階層的特徴学習を活用することで、Matterport3D や ScanNet を含む合成データおよび実世界データセットにおいて、最先端の性能を達成するとともに、未学習のシーンや物体カテゴリへの一般化性能も優れている。

ABSTRACT

Recently, implicit neural representations have gained popularity for learning-based 3D reconstruction. While demonstrating promising results, most implicit approaches are limited to comparably simple geometry of single objects and do not scale to more complicated or large-scale scenes. The key limiting factor of implicit methods is their simple fully-connected network architecture which does not allow for integrating local information in the observations or incorporating inductive biases such as translational equivariance. In this paper, we propose Convolutional Occupancy Networks, a more flexible implicit representation for detailed reconstruction of objects and 3D scenes. By combining convolutional encoders with implicit occupancy decoders, our model incorporates inductive biases, enabling structured reasoning in 3D space. We investigate the effectiveness of the proposed representation by reconstructing complex geometry from noisy point clouds and low-resolution voxel representations. We empirically find that our method enables the fine-grained implicit 3D reconstruction of single objects, scales to large indoor scenes, and generalizes well from synthetic to real data.

研究の動機と目的

  • 従来の暗黙的3次元再構成手法には、全結合アーキテクチャのため単純な幾何形状や1つの物体に限定されるという制限があるため、これを解消すること。
  • 並進不変性や局所的特徴統合といったインダクティブバイアスを組み込むことで、複雑な屋内シーンのスケーラブルな3次元再構成を可能にすること。
  • 合成データから実世界データへの一般化を向上させ、新規の物体カテゴリや部屋のレイアウトに対しても適応可能にすること。
  • 計算的に扱いやすい範囲で、細かな幾何的詳細を保持した高精細な再構成を達成すること。

提案手法

  • モデルは入力データ(ポイントクラウドまたはボクセルグリッド)を処理するための3次元畳み込みエンコーダーを用い、局所的およびグローバルな文脈を符号化する階層的特徴マップを生成する。
  • 3次元占有デコーダーは、三線形補間を用いて学習済みの特徴マップを照会することで、任意の3次元位置における占有状態を予測する。
  • 畳み込み演算が並進変換下でも空間的構造を保持するため、表現は並進不変性を有する。
  • 2次元および3次元の特徴表現をサポートしており、3次元畳み込みにより実世界データに対してより優れた性能を発揮する。
  • 完全畳み込み型のスライディングウィンドウ推論戦略により、複数階の建物など大規模なシーンの再構成が可能である。
  • スパースなポイントクラウドまたはボクセルの監視データに基づき、バイナリクロスエントロピー損失を用いて占有関数の予測を学習する。

実験結果

リサーチクエスチョン

  • RQ1畳み込み演算を導入することで、全結合ネットワークを上回る表現力とスケーラビリティを達成できるか?
  • RQ2並進不変性を組み込むことで、実世界シーンへの再構成品質と一般化性能にどのような影響を与えるか?
  • RQ3統一されたアーキテクチャが、単一物体再構成と大規模シーン再構成の両方を効果的に処理できるか?
  • RQ4メモリ効率、精度、ノイズおよびドメインシフトに対する耐性という観点から、2次元と3次元の特徴表現の性能をどのように比較できるか?

主な発見

  • ScanNet v2 データセットにおいて、3次元ボリューム変種のモデルは、Chamfer-L1 損失 0.077 および F-Score 0.886 を達成し、SPSR(トリムド)を含むすべてのベースラインを上回った。
  • 64³ 解像度の3次元モデルは、ScanNet で F-Score 0.886 を達成し、ノイズおよびドメインシフトに対して強い耐性を示した。
  • Matterport3D データセットでは、学習データとは顕著に異なるドメインシフトが存在するが、2階建ての建物を細かな幾何的詳細と一貫性のある部屋レイアウトを保ちながら再構成できた。
  • 2次元プレーンベースの変種は、よりメモリ効率が良く、合成データでは良好な性能を示したが、3次元ボリューム変種は実世界スキャンへの一般化性能が優れていた。
  • 追加のハイパーパrameter(例:トリミング)が不要な状態で、合成および実世界のベンチマークで最先端の性能を達成した。
  • 定性的な結果から、モデルはメッシュクロージングのアーチファクトが生じない滑らかでシールドされた再構成を生成するのに対し、SPSR は注意深く後処理を施す必要がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。