Skip to main content
QUICK REVIEW

[論文レビュー] VConv-DAE: Deep Volumetric Shape Learning Without Object Labels

Abhishek Sharma, Oliver Grau|arXiv (Cornell University)|Apr 13, 2016
3D Shape Modeling and Analysis参考文献 24被引用数 4
ひとこと要約

本論文では、オブジェクトラベルを一切用いずに、ノイズだらけで不完全な3D形状から教師なしで深層3D形状表現を学習する、完全畳み込み型ボリュームオートエンコーダーVConv-DAEを提案する。入力を汚染されたものから元のボクセル占有グリッドを再構築するように訓練することで、ノイズ除去と形状補完において最先端の性能を達成し、ShapeNetのような教師あり手法を上回りながら、推論時に200倍高速である。

ABSTRACT

With the advent of affordable depth sensors, 3D capture becomes more and more ubiquitous and already has made its way into commercial products. Yet, capturing the geometry or complete shapes of everyday objects using scanning devices (e.g. Kinect) still comes with several challenges that result in noise or even incomplete shapes. Recent success in deep learning has shown how to learn complex shape distributions in a data-driven way from large scale 3D CAD Model collections and to utilize them for 3D processing on volumetric representations and thereby circumventing problems of topology and tessellation. Prior work has shown encouraging results on problems ranging from shape completion to recognition. We provide an analysis of such approaches and discover that training as well as the resulting representation are strongly and unnecessarily tied to the notion of object labels. Thus, we propose a full convolutional volumetric auto encoder that learns volumetric representation from noisy data by estimating the voxel occupancy grids. The proposed method outperforms prior work on challenging tasks like denoising and shape completion. We also show that the obtained deep embedding gives competitive performance when used for classification and promising results for shape interpolation.

研究の動機と目的

  • オブジェクトレベルのアノテーションに依存せずに、ノイズが多く不完全な3Dスキャンから意味のある3D形状表現を学習すること。
  • 3D形状解析における教師ありディープラーニング手法の限界、特に高コストなラベリングと遅い推論の問題を克服すること。
  • ノイズ除去や形状補完のような困難な3D再構築タスクに一般化しやすい、完全畳み込み型でエンドツーエンドで学習可能なオートエンコーダーを構築すること。
  • ShapeNetのような従来のディープラーニングモデルが層ごとの事前学習とサンプリングに基づく推論を必要とするのに対し、スケーラブルで効率的かつ教師なしの代替手法を提供すること。

提案手法

  • 本手法は、ノイズありまたは不完全な3Dボクセルグリッドを、クリアで完全な再構成にマップする完全畳み込み型ボリュームオートエンコーダーを採用する。
  • 入力をランダムに汚染されたボクセルや欠損部分を含むものにすることで、教師なしで訓練し、元のボクセル占有状態を再構築する。
  • 入力が真値形状の汚染版で、出力が予測されたクリアな形状である、ノイズ除去オートエンコーダーの目的関数を用いる。
  • アーキテクチャは完全畳み込み型であり、事前学習を必要とせずエンドツーエンドで学習可能であり、サンプリングに基づく推論を回避することで、推論時の効率が著しく向上する。
  • 学習された潜在表現は、分類、補間、形状補完などの下流タスクのための深層埋め込みとして利用可能である。
  • オブジェクトラベル、パーツアノテーション、対称性制約なしで、大規模なCADデータセットからスクラッチで訓練される。

実験結果

リサーチクエスチョン

  • RQ1完全畳み込み型ボリュームオートエンコーダーは、オブジェクトレベルの監視なしに意味のある3D形状表現を学習できるか?
  • RQ2ボクセル再構築による教師なし学習は、ShapeNetのような教師あり手法と比較して、形状補完およびノイズ除去の性能でどう異なるか?
  • RQ3学習された潜在空間は、形状分類や補間といった下流タスクをサポートできるか?
  • RQ4本モデルは、大きな部分が欠落するようなスライシングノイズのような困難なノイズパターンにも一般化できるか?
  • RQ5本手法の計算効率、特に推論時の性能は、先行研究と比較してどうか?

主な発見

  • VConv-DAEは、ノイズ除去および形状補完の両タスクでShapeNetを上回り、すべてのオブジェクトカテゴリで平均再構築誤差が低かった。
  • スライシングノイズ(30%のボクセル欠落)という困難な状況下でも、VConv-DAEは平均誤差12.75を達成し、ShapeNetの14.85よりも顕著に低い結果を示し、優れた補完能力を示した。
  • 推論時の処理時間を600ms(ShapeNet)からわずか3msに短縮し、200倍の高速化を達成した。これは、推論時にサンプリング処理を一切行わないためである。
  • 学習された潜在空間は、3D形状分類タスクにおいて競争力ある性能を示し、教師なし表現の有効性を裏付けた。
  • 定性的な結果では、VConv-DAEがベッドやナイトスタンドのような複雑な形状においても、ShapeNetよりも少ないアーティファクトで欠損部分を効果的に再構築していることが確認された。
  • 本モデルは、ランダムノイズや構造的ノイズを含む未観測のノイズパターンに対しても良好に一般化しており、そのロバストネスと一般化能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。