Skip to main content
QUICK REVIEW

[論文レビュー] 3D Sketch-aware Semantic Scene Completion via Semi-supervised Structure Prior

Xiaokang Chen, Kwan-Yee Lin|arXiv (Cornell University)|Mar 31, 2020
Advanced Vision and Imaging参考文献 46被引用数 13
ひとこと要約

本論文は、条件付き変分オートエンコーダ(CVAE)に基づく3Dスケッチハリュシネーションモジュールを通じて、半教師あり構造事前分布を用いる3Dスケッチに配慮したセマンティックシーンコンプリートフレームワークを提案する。部分的観測からの完全な3Dスケッチを推定するために、幾何的構造を明示的に符号化することで、3つのベンチマークで低解像度(60×36×60)において最先端の性能を達成し、従来手法よりも最大4.6%高いSSC mIoUを実現した。

ABSTRACT

The goal of the Semantic Scene Completion (SSC) task is to simultaneously predict a completed 3D voxel representation of volumetric occupancy and semantic labels of objects in the scene from a single-view observation. Since the computational cost generally increases explosively along with the growth of voxel resolution, most current state-of-the-arts have to tailor their framework into a low-resolution representation with the sacrifice of detail prediction. Thus, voxel resolution becomes one of the crucial difficulties that lead to the performance bottleneck. In this paper, we propose to devise a new geometry-based strategy to embed depth information with low-resolution voxel representation, which could still be able to encode sufficient geometric information, e.g., room layout, object's sizes and shapes, to infer the invisible areas of the scene with well structure-preserving details. To this end, we first propose a novel 3D sketch-aware feature embedding to explicitly encode geometric information effectively and efficiently. With the 3D sketch in hand, we further devise a simple yet effective semantic scene completion framework that incorporates a light-weight 3D Sketch Hallucination module to guide the inference of occupancy and the semantic labels via a semi-supervised structure prior learning strategy. We demonstrate that our proposed geometric embedding works better than the depth feature learning from habitual SSC frameworks. Our final model surpasses state-of-the-arts consistently on three public benchmarks, which only requires 3D volumes of 60 x 36 x 60 resolution for both input and output. The code and the supplementary material will be available at https://charlesCXK.github.io.

研究の動機と目的

  • 低解像度ボクセル表現に起因するセマンティックシーンコンプリート(SSC)の性能ボトルネックを解消すること。
  • 暗黙の深度特徴に依存するのではなく、3Dスケッチを用いて幾何的構造を明示的に符号化することで、シーン再構築とセマンティックラベル付けの精度を向上させること。
  • 遮蔽や不完全なシーンにおける補完をガイドする構造事前分布を活用する、軽量で効果的なフレームワークを開発すること。
  • 明示的な幾何的埋め込みとしての3Dスケッチが、低解像度設定において暗黙の深度特徴学習を上回ることを実証すること。

提案手法

  • 解像度に依存しない方法で、部屋のレイアウトや物体のサイズ/形状などの幾何的構造を符号化する3Dスケッチに配慮した特徴埋め込みを導入する。
  • 部分的な2D/2.5D観測から妥当な完全な3Dスケッチを生成するため、条件付き変分オートエンコーダ(CVAE)に基づく3Dスケッチハリュシネーションモジュールを提案する。
  • 2段階フレームワークを採用:まず入力(TSDFまたはRGB)から3Dスケッチをハリュシネートし、次にハリュシネートされたスケッチを用いて占有状態とセマンティック予測をガイドする。
  • CVAEの事前分布を活用することで、構造的一致性を保ちつつ多様で現実的な3Dスケッチを生成する半教師あり学習を採用する。
  • 構造予測にはTSDF、セマンティック精緻化にはRGBを用い、マルチモodalな設定で各モodalの特長を活かす。
  • 60×36×60ボクセル解像度で高い精度を達成しながらも、高い効率性を維持する軽量なネットワークを設計する。

実験結果

リサーチクエスチョン

  • RQ1暗黙の深度特徴学習と比較して、明示的な3Dスケッチベースの幾何的埋め込みがセマンティックシーンコンプリートの性能を向上させるか?
  • RQ2CVAEによる半教師あり構造事前分布が、低解像度設定における見えないシーン領域の再構築を向上させるか?
  • RQ33Dスケッチの解像度に依存しない性質が、不完全または低解像度入力における性能に与える影響は何か?
  • RQ4マルチモーダル入力(TSDF + RGB)が、構造事前分布とセマンティックラベル付け精度の両方を向上させるか?

主な発見

  • 本手法は、60×36×60の入出力解像度でのみ使用して、3つの公的ベンチマーク(NYU、NYUCAD、ScanNet)で最先端の性能を達成した。
  • 暗黙の深度特徴に依存せず、教師なしのベースラインと比較して、SSC mIoUは4.6%、SC IoUは3.1%向上した。
  • スケッチハリュシネーションにTSDFを入力することで、RGBのみ入力した場合に比べてSC IoUが3.3%向上し、構造予測において幾何的入力の優位性を示した。
  • スケッチ生成にTSDF、セマンティック精緻化にRGBを組み合わせた場合、TSDF単体を使用した場合に比べてSSC mIoUが3.9%向上した。
  • 入出力解像度を60×60から80×80に引き上げることで、NYUCADではSC IoUが5.0%向上(84.2%から86.0%)したが、高いセマンティック一貫性を維持した。
  • 定性的な結果から、CVAEベースのハリュシネーションモジュールが、より鋭く、より完全なスケッチを生成し、境界が明瞭で、より正確かつ一貫性のあるセマンティック予測をもたらすことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。