Skip to main content
QUICK REVIEW

[論文レビュー] RGBD Based Dimensional Decomposition Residual Network for 3D Semantic Scene Completion

Jie Li, Yu Liu|arXiv (Cornell University)|Mar 2, 2019
Advanced Vision and Imaging参考文献 43被引用数 12
ひとこと要約

本稿では、次元分解残差(DDR)ブロックとRGBおよび深度特徴のマルチスケール統合を用いた、軽量なRGBDベースの3Dセマンティックシーンコンプリートネットワークを提案する。3D畳み込みを因子分解し、複数スケールでのモダリティ固有の特徴を統合することで、SSCNetと比較して21%少ないパラメータと16.6%少ないFLOPsで、NYUおよびNYUCADデータセットで最先端の性能を達成し、SC-IoUを5.9%向上、SSC-IoUを5.7%向上した。

ABSTRACT

RGB images differentiate from depth images as they carry more details about the color and texture information, which can be utilized as a vital complementary to depth for boosting the performance of 3D semantic scene completion (SSC). SSC is composed of 3D shape completion (SC) and semantic scene labeling while most of the existing methods use depth as the sole input which causes the performance bottleneck. Moreover, the state-of-the-art methods employ 3D CNNs which have cumbersome networks and tremendous parameters. We introduce a light-weight Dimensional Decomposition Residual network (DDR) for 3D dense prediction tasks. The novel factorized convolution layer is effective for reducing the network parameters, and the proposed multi-scale fusion mechanism for depth and color image can improve the completion and segmentation accuracy simultaneously. Our method demonstrates excellent performance on two public datasets. Compared with the latest method SSCNet, we achieve 5.9% gains in SC-IoU and 5.7% gains in SSC-IOU, albeit with only 21% network parameters and 16.6% FLOPs employed compared with that of SSCNet.

研究の動機と目的

  • 3Dセマンティックシーンコンプリート(SSC)における性能ボトルネックを、深度入力に依存するのみであることに起因する問題を解決すること。
  • 通常は巨大でパラメータが多くなる3D畳み込みニューラルネットワークの計算コストを低減すること。
  • マルチスケール特徴統合を通じて、RGBと深度のモダリティを効果的に統合することで、SSCの精度を向上させること。
  • 少ないパラメータとFLOPsで高い性能を維持する軽量なアーキテクチャを開発すること。

提案手法

  • 3D畳み込みを因子分解することで、性能を損なわずにモデルパラメータを著しく削減する、次元分解残差(DDR)ブロックを導入する。
  • ネットワークの複数レベルでRGBおよび深度入力からの特徴をシームレスに統合するマルチスケール統合機構を採用する。
  • パラメータ増加を最小限に抑えるために、DDRブロックに基づく軽量ASPP(LW-ASPP)モジュールを用いる。
  • 3D形状コンプリートとセマンティックラベリングを同時に最適化するエンドツーエンドの学習フレームワークを設計する。
  • 3Dシーンボリュームを正確に幾何表現できるように、切断符号付き距離関数(TSDF)を適用する。
  • 深層ネットワークにおける学習安定化と特徴表現の向上を図るため、残差学習フレームワークを採用する。

実験結果

リサーチクエスチョン

  • RQ1因子分解された3D畳み込みブロックは、3D密度予測タスクにおいてパラメータを削減しながらも、性能を維持または向上させることができるか?
  • RQ2RGBと深度特徴を複数スケールで効果的に統合することで、3Dシーンコンプリートとセマンティックラベリングの性能がどの程度向上するか?
  • RQ3DDRブロックとLW-ASPPを用いた軽量ネットワークは、SSCNetのような重い最先端モデルと比較して、精度と効率の両面で優れているか?
  • RQ4RGBと深度のモダリティは、3Dセマンティックシーンコンプリートにおいてどの程度補い合っているか?
  • RQ5より少ないFLOPsとパラメータで、より小さなネットワークが、より大きなモデルと同等またはそれ以上の性能を達成できるか?

主な発見

  • 提案されたDDRネットワークは、NYUおよびNYUCADデータセットにおいて、SSCNetと比較してSC-IoUが5.9%高く、SSC-IoUが5.7%高い性能を達成した。
  • SSCNetの21%のパラメータと16.6%のFLOPsしか使用しないにもかかわらず、コンプリート精度とセグメンテーション精度の両方でSSCNetを上回った。
  • RGBと深度特徴のマルチスケール統合により性能が顕著に向上し、RGBはセマンティック精度に、深度は幾何的一致性に寄与している。
  • アブレーションスタディの結果、深度またはRGB入力のみを用いると性能が低下(それぞれ28.9%および27.2%のSSC-IoU)し、モダリティ統合の有効性が裏付けられた。
  • LW-ASPPモジュールは、ASPPなしと比較してSC-IoUを3.2%、SSC-IoUを3.6%向上させたが、パラメータはほとんど増加しなかった。
  • DDRNetはGTX 1080tiで44 FPSの推論速度を達成し、SSCNet(0.7 FPS)と比べて著しく高速であり、メモリ使用量も低く、精度の低下はわずかであった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。