Skip to main content
QUICK REVIEW

[論文レビュー] 3D Gated Recurrent Fusion for Semantic Scene Completion

Yu Liu, Jie Li|arXiv (Cornell University)|Feb 17, 2020
Advanced Vision and Imaging参考文献 45被引用数 22
ひとこと要約

本論文では、選択的特徴選択のためのゲート機構と補完的情報を保持するメモリユニットを用いて、RGBと深度特徴を適応的に統合する3次元ゲート付き再帰的統合ネットワーク、GRFNetを提案する。この手法は、NYUおよびNYUCADデータセットで最先端の性能を達成し、NYUでは32.9%のmIoUを記録し、LSTMベースの統合手法よりも2.7%の向上を達成した。

ABSTRACT

This paper tackles the problem of data fusion in the semantic scene completion (SSC) task, which can simultaneously deal with semantic labeling and scene completion. RGB images contain texture details of the object(s) which are vital for semantic scene understanding. Meanwhile, depth images capture geometric clues of high relevance for shape completion. Using both RGB and depth images can further boost the accuracy of SSC over employing one modality in isolation. We propose a 3D gated recurrent fusion network (GRFNet), which learns to adaptively select and fuse the relevant information from depth and RGB by making use of the gate and memory modules. Based on the single-stage fusion, we further propose a multi-stage fusion strategy, which could model the correlations among different stages within the network. Extensive experiments on two benchmark datasets demonstrate the superior performance and the effectiveness of the proposed GRFNet for data fusion in SSC. Code will be made available.

研究の動機と目的

  • RGBと深度モダリティを効果的に統合するという課題に取り組むこと。この場合、各モダリティは補完的ではあるが重複する情報を提供する。
  • RGBと深度から関連する特徴を選択的に統合しつつ、欠落または曇っている詳細を保持する学習可能な、適応的統合メカニズムを開発すること。
  • マルチステージ統合戦略を通じて、低レベルおよび高レベル特徴を活用することで、SSC性能を向上させること。
  • 和集合、最大値、連結、双線形統合などの従来の統合手法(sum, max, concatenate, bilinear fusion)を上回るために、再帰的でゲート付きのアーキテクチャを導入すること。

提案手法

  • GRFNetは、ゲート付き再帰ユニット(GRUs)をインspiredした新規なゲート付き再帰的統合(GRF)ブロックを採用しており、RGBと深度入力からの重要な特徴を適応的に選択するためのゲート機構を用いる。
  • GRFブロックは、モダリティ特徴間の補完的情報を保持・伝達するメモリコンponentを統合しており、遮蔽や欠損データに対してより頑健になる。
  • 単一ステージGRFNetは、1つのネットワークステージからの特徴をGRFブロックで統合するが、マルチステージGRFNetは複数のエンコーダ・デコーダステージにわたってGRFブロックを段階的に適用し、低レベルおよび高レベル特徴を統合する。
  • マルチステージ統合戦略は、異なるネットワークステージからの特徴を順次処理することで、統合表現を段階的に精錬する。
  • GRFブロックは3次元畳み込みを用いて実装され、アラインされたRGB-Dボクセルグリッド上で動作するため、モダリティ統合のエンドツーエンド学習が可能になる。
  • フレームワークは、セマンティックラベリングとシーンコンプリートの両方の目的関数として交差エントロピー損失と交差率(IoU)損失を用いてエンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1和集合、最大値、連結といった手作業で設計された統合演算(sum, max, concatenate)よりも、学習可能な再帰的統合メカニズムがRGB-深度統合においてSSCで優れた性能を発揮できるか?
  • RQ2統合ブロックにメモリ機構を組み込むことで、モダリティ間で補完的情報を保持でき、性能向上が達成できるか?
  • RQ3異なるネットワーク深さからの特徴を統合するマルチステージ統合は、単一ステージ統合よりもSSCの正確性を向上させられるか?
  • RQ4ベンチマークデータセットにおけるmIoUおよびIoUの観点から、提案されたGRFNetは、既存の最先端手法を上回っているか?

主な発見

  • GRFNetはNYUデータセットで32.9%のmIoUを達成し、ベースラインのDDR-SSCおよび既存の統合手法を上回った。
  • GRF統合ブロックは、NYUとNYUCADでそれぞれLSTM統合よりも2.7%および3.4%高いmIoUを達成したが、パrameter数は少ない。
  • マルチステージGRFNetは、シーンコンプリートの平均IoUがDDR-SSCよりも0.2%高く、セマンティックシーンコンプリートでは2.5%高い。
  • アブレーションスタディの結果、ゲート機構は非ゲート統合に比べて性能を顕著に向上させ、メモリコンponentはさらに精度を向上させた。
  • GRFNetは、和集合、最大値、連結統合よりもmIoUで2.5~3.5ポイント高い結果を示し、適応的でゲート付きの統合の優位性を裏付けた。
  • FLOPsは統合ステージの増加に伴い増加するが、GRFブロックの再利用によりパrameterの増加は最小限に抑えられ、モデルスケーリングの効率性が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。