Skip to main content
QUICK REVIEW

[論文レビュー] Depth-Adapted CNNs for RGB-D Semantic Segmentation

Zongwei Wu, Guillaume Allibert|arXiv (Cornell University)|Jun 8, 2022
Industrial Vision Systems and Defect Detection被引用数 7
ひとこと要約

本論文は、3次元平面の整合性に基づいて受容 field を再定義する幾何学的注意をもつサンプリング位置を学習することで、RGB畳み込みニューラルネットワークに直接的に深度情報を統合する、新しい深さ適合型CNNフレームワークZ-ACNを提案する。標準的な畳み込みおよび平均プーリングを、3次元平面の整合性に基づいて受容 field を再形状化する深さ適合型演算子に置き換えることで、屋内および屋外のRGB-Dベンチマークにおいて、最小限の計算コストで、最先端の性能を達成する。

ABSTRACT

Recent RGB-D semantic segmentation has motivated research interest thanks to the accessibility of complementary modalities from the input side. Existing works often adopt a two-stream architecture that processes photometric and geometric information in parallel, with few methods explicitly leveraging the contribution of depth cues to adjust the sampling position on RGB images. In this paper, we propose a novel framework to incorporate the depth information in the RGB convolutional neural network (CNN), termed Z-ACN (Depth-Adapted CNN). Specifically, our Z-ACN generates a 2D depth-adapted offset which is fully constrained by low-level features to guide the feature extraction on RGB images. With the generated offset, we introduce two intuitive and effective operations to replace basic CNN operators: depth-adapted convolution and depth-adapted average pooling. Extensive experiments on both indoor and outdoor semantic segmentation tasks demonstrate the effectiveness of our approach.

研究の動機と目的

  • 既存の2ストリーム型およびイ早融合型RGB-Dネットワークが、特徴抽出段階で深度の手がかりを効果的に活用できないという限界を解消すること。
  • 深度情報を明示的に用いて、RGB特徴抽出における空間的サンプリングをガイドすることで、文脈認識を向上させること。
  • 標準的なCNN演算子を置き換える深さ適合型演算子を導入し、事前学習済みモデルとの互換性を維持すること。
  • 内部カメラパラメータの変動や現実世界の深度誤差に対して、手法の頑健性を検証すること。
  • 多様な屋内および屋外データセットにわたる一般化性能を示し、顕著な性能向上を達成すること。

提案手法

  • 中心ピクセルと同一の3次元平面を共有するピクセルを選択することで、受容 field を再定義する深さ適合型畳み込み(Z-Conv)を提案。深度およびカメラパラメータを用いて2次元オフセットを計算する。
  • 通常のグリッド近傍ではなく、幾何学的に一貫性のある領域の平均を計算する深さ適合型平均プーリング(Z-AvgPool)を導入。
  • 低レベルの深度特徴を用いて、サンプリングをガイドする空間的オフセットマップを生成し、特徴マップ全体で幾何的整合性を確保する。
  • 深度およびカメラ内部パラメータによって完全に制約された微分可能で学習可能なオフセット生成モジュールを採用し、エンド・ツー・エンドの学習を可能にする。
  • VGGおよびResNetエンコーダの両方に対して演算子を適用し、既存のCNNアーキテクチャへの最小限の変更で統合可能であることを実証。
  • 事前学習済みImageNet重みからの微調整を含め、スクラッチからの学習も実施し、移行可能性および頑健性を示す。

実験結果

リサーチクエスチョン

  • RQ1追加パラメータを追加せずに、深度情報がRGB CNNにおける空間的サンプリングを効果的にガイドできるか。
  • RQ2標準的な畳み込みおよびプーリングを深さ適合型演算子に置き換えることで、RGB-Dデータにおけるセマンティックセグメンテーションの精度が向上するか。
  • RQ3内部カメラパラメータの不正確さや深度推定誤差に対して、この手法はどれほど頑健か。
  • RQ4異なるネットワーク深さに応じて、深さ適合型演算子が性能にどれほど寄与するか。
  • RQ5提案された演算子は、事前学習済みImageNet重みを用いて効果的に移行および微調整可能か。

主な発見

  • NYUv2では、真値の内部パラメータを使用した場合、Z-ACNは42.5%のmIoUおよび55.2%のmAccを達成し、ベースライン(40.4% mIoU、51.9% mAcc)を顕著に上回る。
  • ランダムに選択された内部パラメータでさえも、Z-ACNは強力な性能(41.6% mIoU、53.4% mAcc)を維持し、パラメータの不確実性に対する頑健性を示す。
  • スクラッチからの学習において、最も深い層の最初の畳み込み(Conv5_1)をZ-Convに置き換えると、ベースライン比で3.6%のmIoU向上が得られる。
  • すべての最初の畳み込み層をZ-Convに置き換えると、ベースライン比でmIoUが5.7%向上し、初期段階での幾何的ガイドの有効性を確認する。
  • Z-Convと併用してZ-AvgPoolを導入することで、mIoUがさらに0.9%向上し、幾何学的プーリングの利点を裏付ける。
  • 事前学習済み重みからの微調整において、最も深い層の最初の畳み込みをZ-Convに置き換えると、ベースライン比でmIoUが1.8%向上し、転移学習との互換性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。