Skip to main content
QUICK REVIEW

[論文レビュー] Anisotropic Convolutional Networks for 3D Semantic Scene Completion

Jie Li, Kai Han|arXiv (Cornell University)|Apr 5, 2020
Advanced Vision and Imaging参考文献 24被引用数 14
ひとこと要約

本論文は、3次元セマンティックシーンコンプリートのための非等方的畳み込みネットワーク(AIC-Net)を提案し、3次元畳み込みを学習可能なカーネルサイズの組み合わせを有する3つの1次元畳み込みに分解することで、ボクセルごとに適応的に受容 field を学習する、新しい非等方的畳み込みモジュールを導入している。本手法は、標準的な3次元畳み込みと比較して、精度とパラメータ効率の両面で向上し、NYU-Depth-v2およびNYUCADベンチマークで最先端の性能を達成した。

ABSTRACT

As a voxel-wise labeling task, semantic scene completion (SSC) tries to simultaneously infer the occupancy and semantic labels for a scene from a single depth and/or RGB image. The key challenge for SSC is how to effectively take advantage of the 3D context to model various objects or stuffs with severe variations in shapes, layouts and visibility. To handle such variations, we propose a novel module called anisotropic convolution, which properties with flexibility and power impossible for the competing methods such as standard 3D convolution and some of its variations. In contrast to the standard 3D convolution that is limited to a fixed 3D receptive field, our module is capable of modeling the dimensional anisotropy voxel-wisely. The basic idea is to enable anisotropic 3D receptive field by decomposing a 3D convolution into three consecutive 1D convolutions, and the kernel size for each such 1D convolution is adaptively determined on the fly. By stacking multiple such anisotropic convolution modules, the voxel-wise modeling capability can be further enhanced while maintaining a controllable amount of model parameters. Extensive experiments on two SSC benchmarks, NYU-Depth-v2 and NYUCAD, show the superior performance of the proposed method. Our code is available at https://waterljwant.github.io/SSC/

研究の動機と目的

  • 物体の形状、レイアウト、可視性に著しい変動が生じる3次元シーンの文脈をモデル化する課題に対処すること。
  • 多様な空間的構造を捉えるために、固定された受容 field を持つ3次元畳み込みの限界を克服すること。
  • 標準的な3次元畳み込みの代替として、パラメータ効率的で柔軟な手法を開発すること。
  • 既存の3次元CNNアーキテクチャに即座に統合可能なプラグアンドプレイな統合を可能にすること。
  • 計算コストを低減しつつ、セマンティックシーンコンプリートベンチマークで優れた性能を達成すること。

提案手法

  • 3次元畳み込みをx、y、z軸に沿って連続する3つの1次元畳み込みに分解する非等方的畳み込み(AIC)モジュールを提案する。
  • 各1次元畳み込みは、候補となるカーネルサイズの集合(例:{3,5,7})を用い、ボクセルごとに学習可能な融合重みを用いて、適応的かつ非等方的な受容 field を形成する。
  • カーネルサイズの選択はボクセル単位で実行され、局所的なシーンの幾何学的・意味的特徴に基づいた動的文脈モデリングを可能にする。
  • パラメータ効率を維持するために、チャネル次元を低減したボトルネック構造をAICモジュールが採用する。
  • AIC-Netアーキテクチャは複数のAICモジュールをスタックし、2次元特徴抽出と3次元特徴投影を統合して、エンドツーエンド学習を実現する。
  • 特徴の忠実性を保持し、ディープな監視を可能にするために、ポイントワイズ畳み込みとスキップ接続を採用する。

実験結果

リサーチクエスチョン

  • RQ1高い物体変動性下でも、適応的かつボクセル単位の受容 field が3次元セマンティックシーンコンプリートの性能を向上させ得るか?
  • RQ2複雑な3次元シーン構造をモデル化する際、非等方的畳み込みは標準的な3次元畳み込みと比較してどのように優れているか?
  • RQ3非等方的畳み込みは、性能を維持または向上させつつ、モデルのパラメータ数と計算量をどの程度削減できるか?
  • RQ4AICモジュールは、既存のネットワークにおける標準的な3次元畳み込みの代替として、効果的にプラグアンドプレイに使用可能か?
  • RQ5提案手法は、異なる3次元シーンコンプリートベンチマークに一般化可能か?

主な発見

  • AIC-Netは、NYU-Depth-v2およびNYUCADベンチマークの両方で最先端の性能を達成し、SSCNet や DDRNet といった既存手法を上回った。
  • NYU-Depth-v2では、平均交差率(mIoU)が64.7%に達し、以前の最先端手法よりも顕著に高い水準であった。
  • NYUCADではmIoUが62.1%に達し、多様なシーンレイアウトを持つデータセット間でも強力な一般化性能を示した。
  • AICモジュールは、標準的な3次元畳み込みと比較してパラメータ数とFLOPsを削減しながら、精度を維持または向上させた。
  • 定性的な結果から、AIC-Netはよりクリアで正確な3次元セマンティック予測を生成し、形状とカテゴリの整合性が向上していることが示された。
  • アブレーションスタディの結果、適応的カーネルサイズ選択と1次元分解が、複雑な3次元構造のモデリングに成功する鍵であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。