Skip to main content
QUICK REVIEW

[論文レビュー] Incorporating Depth into both CNN and CRF for Indoor Semantic Segmentation

Jindong Jiang, Zhijun Zhang|arXiv (Cornell University)|May 21, 2017
Advanced Image and Video Retrieval Techniques参考文献 1被引用数 11
ひとこと要約

本稿では、拡張畳み込み全結合畳み込みネットワーク(DFCN)と深さに敏感な条件付きランダムフィールド(DCRF)の両方に深さ情報を統合する、新しいRGB-Dセマンティックセグメンテーションフレームワーク、DFCN-DCRFを提案する。ネットワークの初期段階でRGBと深さ入力を統合し、深さに敏感なCRFによる精緻化を適用することで、SUN RGB-Dベンチマークで最先端の性能を達成し、平均IoUが39.3%に達した。これは、深さ情報を一つのコンponentでのみ使用する既存手法を上回っている。

ABSTRACT

To improve segmentation performance, a novel neural network architecture (termed DFCN-DCRF) is proposed, which combines an RGB-D fully convolutional neural network (DFCN) with a depth-sensitive fully-connected conditional random field (DCRF). First, a DFCN architecture which fuses depth information into the early layers and applies dilated convolution for later contextual reasoning is designed. Then, a depth-sensitive fully-connected conditional random field (DCRF) is proposed and combined with the previous DFCN to refine the preliminary result. Comparative experiments show that the proposed DFCN-DCRF has the best performance compared with most state-of-the-art methods.

研究の動機と目的

  • RGBデータに加えて深さ情報を活用することで、屋内セマンティックセグメンテーションの精度を向上させること。
  • 特に同じ色の物体が存在するシーンにおいて、RGBのみのCNNで生じる境界誤分類を是正すること。
  • 深さ情報をCNNとCRFの両コンponentに統合する共同アーキテクチャを設計し、より良い文脈的推論を実現すること。
  • 深さ統合が特徴学習段階と後処理段階の両方で有効であることを検証すること。

提案手法

  • DFCNモジュールは、遅延統合構造を用いて初期畳み込み層でRGBと深さ入力を統合し、ダウンサンプリングを伴わずに受容 field を拡大するための拡張畳み込みを適用する。
  • RGBと深さ特徴をCRFの潜在関数に用いることで、ピクセルレベルの依存関係をモデル化する深さに敏感な全結合CRF(DCRF)を設計する。
  • DFCN-DCRFフレームワークは、DFCNの高レベル特徴とDCRFの文脈的精緻化を組み合わせることで、セグメンテーション境界の改善を図る。
  • DCRFは、RGBの外観が似ているが3次元構造が異なる物体をよりよく区別できるように、学習された深さに敏感なペアワイズ潜在関数を用いる。
  • DFCNでは交差エントロピー損失を用いてエンドツーエンドで学習し、DCRFでは近似推論により最適化を行う。
  • 除去実験では、SUN RGB-Dベンチマークを用いて、DFCN、DCRF、または両方に深さ統合を行う場合を比較した。

実験結果

リサーチクエスチョン

  • RQ1CNNとCRFの両段階に深さを統合することで、一方の段階でのみ深さを使用する場合に比べて、より優れたセマンティックセグメンテーションが達成できるか?
  • RQ2DFCNに深さを統合することで、RGBのみのネットワークと比較して特徴表現にどのような影響を与えるか?
  • RQ3深さに敏感なCRFは、色が似た物体が存在する屋内シーンにおける境界予測を改善できるか?
  • RQ4全体の性能向上に寄与する深さ統合の貢献度は、DFCNとDCRFのどちらに大きいのか?

主な発見

  • DFCN-DCRFモデルはSUN RGB-Dベンチマークで平均IoUが39.3%を達成し、以前の最先端手法であるFuseNet-SF5を上回った。
  • DFCNに深さを統合するだけで顕著な性能向上(38.0% IoU)が得られ、初期統合が特徴学習を強化していることが示された。
  • DFCNに深さを統合せず、DCRFにのみ深さを統合した場合(DFCNに深さなし)は、わずかな改善(34.4% IoU)にとどまり、後処理段階でのみ深さを使用する場合の利点は限定的であることが示唆された。
  • DFCNとDCRFの両方に深さを統合した場合が最良の性能(39.3% IoU)を達成し、初期統合と後段統合の相乗効果が確認された。
  • RGBのみのDFCNにCRFを追加した場合と比較して、DFCN-DCRFモデルは平均正答率を1.9パーセンテージポイント向上させ、二段階にわたる深さ統合の有効性を示した。
  • 可視化結果から、DFCN-DCRFは特にRGBカラーが似ているが3次元構造が異なる物体に対して、より鋭い境界を生成することがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。