Skip to main content
QUICK REVIEW

[論文レビュー] Learning 3D Shapes as Multi-Layered Height-maps using 2D Convolutional Networks

Kripasindhu Sarkar, Basavaraj Hampiholi|arXiv (Cornell University)|Jul 23, 2018
3D Shape Modeling and Analysis参考文献 28被引用数 6
ひとこと要約

本論文は、ボクセル化を回避する3次元形状のためのマルチレイヤーヒエイトマップ(MLH)表現を提案し、効率的な2次元畳み込みニューラルネットワーク(CNN)が幾何的特徴を学習可能にする。各グリッドポイントに複数のヒエイトマップレイヤーを格納し、新規のマージ技術を用いてマルチビュー特徴を統合することで、ModelNet40で90.97%の最先端性能を達成。メモリ効率はOctNetと同等であり、分類および3次元形状生成の両方を可能にするマルチビューGANを用いる。

ABSTRACT

We present a novel global representation of 3D shapes, suitable for the application of 2D CNNs. We represent 3D shapes as multi-layered height-maps (MLH) where at each grid location, we store multiple instances of height maps, thereby representing 3D shape detail that is hidden behind several layers of occlusion. We provide a novel view merging method for combining view dependent information (Eg. MLH descriptors) from multiple views. Because of the ability of using 2D CNNs, our method is highly memory efficient in terms of input resolution compared to the voxel based input. Together with MLH descriptors and our multi view merging, we achieve the state-of-the-art result in classification on ModelNet dataset.

研究の動機と目的

  • 2次元CNNと互換性があり、ボクセルグリッドの高コストなメモリ使用を回避する幾何学的中心の3次元形状表現を開発すること。
  • 新規のビュー統合技術を用いてマルチビュー3次元形状情報の効果的統合を可能にし、分類性能の向上を図ること。
  • OctNetのような高度な3次元CNNと同等のメモリ効率を維持しながら、3次元形状分類で最先端の性能を示すことを目的とする。
  • マルチビューGANアーキテクチャを用いて、MLH記述子を用いた3次元形状生成の可能性を検討すること。

提案手法

  • 3次元形状を、各グリッドポイントに複数の高さ値を格納することで、表面の隠蔽された詳細を符号化するマルチレイヤーヒエイトマップ(MLH)として表現する。
  • メッシュトポロジーや事前処理を必要とせず、点群から直接MLH記述子を構築する。
  • 各MLH記述子に2次元CNN(VGG-16)を適用し、2次元グリッド表現から局所的およびグローバル特徴を抽出する。
  • 3つの異なるビューからの特徴を1つのコンactな記述子に統合する非可換マージ操作を備えたマルチビューCNNを設計する。
  • 共有ジェネレータブランチとマルチビュー判別器を備えたマルチビューGAN(MV-DCGAN)を用い、MLH記述子を用いて潜在ノイズから3次元形状を生成する。
  • ジェネレータでは逆畳み込みを、判別器では標準畳み込みを用い、両方のブランチに5段階のアップサンプリングおよびダウンサンプリングを実装する。

実験結果

リサーチクエスチョン

  • RQ12次元CNNがマルチレイヤーヒエイトマップ表現に適用された場合、3次元形状特徴を効果的に学習できるか?
  • RQ2提案されたマルチビュー統合技術は、単一ビューまたは単純平均化手法と比較して、分類精度を顕著に向上させるか?
  • RQ3MLH記述子は、ボクセルベースやメッシュベースの手法と同等の性能を発揮しながら、分類および3次元形状生成の両方のタスクをサポートできるか?
  • RQ4特に高入力解像度下において、MLHベースの2次元CNNは、OctNetのような最先端の3次元CNNと比較して、どの程度のメモリ効率を示すか?

主な発見

  • 提案手法は、単一ビューのMLH記述子とVGG-16を用いてModelNet40で90.97%の分類精度を達成し、従来手法を上回った。
  • 非可換マージを用いたマルチビューCNNはModelNet40で90.72%の精度を達成し、提案された特徴統合戦略の有効性を示した。
  • バッチサイズ32の単一ビューMLHベースのネットワークのメモリフットプリントは、GeForce GTX 1080 Tiで約8 GBであり、OctNet256と同等のメモリ効率を示したが、2次元CNNの構造はより単純であった。
  • マルチビューGAN(MV-DCGAN)は、チェアやカーの質的結果から、一貫性のある幾何的特徴を持つ3次元形状を効果的に生成した。
  • MLH記述子は、2次元グリッド上の2次元CNNが複雑なタスクに十分な幾何的情報を保持していることを示しており、有効な3次元形状生成を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。