Skip to main content
QUICK REVIEW

[論文レビュー] Attention-based Dual Supervised Decoder for RGBD Semantic Segmentation

Yang Zhang, Yang Yang|arXiv (Cornell University)|Jan 5, 2022
Advanced Neural Network Applications被引用数 10
ひとこと要約

本論文は、エンコーダーおよびデコーダーにおける特徴統合を向上させる、RGBDセマンティックセグメンテーションのためのアテンションベースのデュアルスラブドデコーダーを提案する。エンコーダーにマルチモーダル統合モジュールを導入し、ピラミッド監視を備えたデュアルブランチデコーダーを採用することで、クロスマodal表現学習と学習収束性が向上し、NYUDv2(52.5% mIoU)およびSUN-RGBD(62.1% mAcc.)データセットで最先端の性能を達成した。

ABSTRACT

Encoder-decoder models have been widely used in RGBD semantic segmentation, and most of them are designed via a two-stream network. In general, jointly reasoning the color and geometric information from RGBD is beneficial for semantic segmentation. However, most existing approaches fail to comprehensively utilize multimodal information in both the encoder and decoder. In this paper, we propose a novel attention-based dual supervised decoder for RGBD semantic segmentation. In the encoder, we design a simple yet effective attention-based multimodal fusion module to extract and fuse deeply multi-level paired complementary information. To learn more robust deep representations and rich multi-modal information, we introduce a dual-branch decoder to effectively leverage the correlations and complementary cues of different tasks. Extensive experiments on NYUDv2 and SUN-RGBD datasets demonstrate that our method achieves superior performance against the state-of-the-art methods.

研究の動機と目的

  • セマンティックセグメンテーションにおいて、RGBと深度情報の両モーダルを効果的に統合する課題に対処すること。
  • デコーダーの学習とエンコーダーの学習の不均衡を解消するために、デュアルブランチデコーダーのアーキテクチャを導入すること。
  • 関連タスクからの補助監視を用いたマルチタスク distillation を通じて、セグメンテーション性能を向上させること。
  • 複数スケールにわたるクロスマodal相関を活用することで、特徴表現学習を強化すること。

提案手法

  • RGBと深度の両ストリームから得られる深層的で多段階の補完的特徴を抽出・統合する、アテンションベースのマルチモーダル統合(AMF)モジュールをエンコーダーに導入する。
  • 主ブランチがASPPを用いてマルチスケールの文脈を捉えるセマンティックセグメンテーションを実行する一方、補助ブランチがタスクガイドド監視(例:法線推定や深度推定)を提供するデュアルブランチデコーダーを採用する。
  • 主ブランチにおけるピラミッド監視により、深層表現学習を強化し、境界の正確性を向上させる。
  • 2段階の訓練戦略を適用する:まず深度または法線ガイドド補助ブランチで事前学習を行い、その後、セマンティックガイドド監視で微調整することで、学習の安定性と収束性を向上させる。
  • スカイプ接続と特徴マップの連結を活用し、デコーダー経路全体で空間的詳細を保持し、特徴マップを豊かにする。
  • バックボーンとしてResNet-50を採用し、最先端手法との公平な比較のため単一スケール推論を適用する。

実験結果

リサーチクエスチョン

  • RQ1複数レベルでのRGBと深度モーダルの連合推論は、セマンティックセグメンテーションの精度向上に寄与するか?
  • RQ2マルチタスク distillation を備えたデュアルブランチデコーダーは、学習収束性とモデル性能にどのように影響を与えるか?
  • RQ3エンコーダーにおけるアテンションベースのマルチモーダル統合は、要素ごとの統合やゲーテッド統合と比較して、特徴表現学習をどの程度向上させるか?
  • RQ4関連タスク(例:法線推定)からの補助監視は、困難なカテゴリのセグメンテーションのロバスト性を向上させるか?

主な発見

  • 提案手法は、同じ評価プロトコル下で、NYUDv2で52.5% mIoUを達成し、従来の最先端手法を上回った。
  • SUN-RGBDデータセットでは、62.1% mAcc.を達成し、前回の最良手法と比較して4.1%の向上を示し、大規模データに対して優れた性能を示した。
  • デュアルブランチデコーダーは学習を著しく安定化させ、収束を加速し、このような監視が無いモデルと比較して損失の振動を低減した。
  • ベッド、カーテン、 dresser、シャワー、ボードといった難易度の高いカテゴリにおいて特に優れた性能を示し、曖昧または複雑なシーンに対してもロバストであることが示された。
  • 事前学習段階で深度ガイドド監視のみを用いても、PAP や PSD といったマルチタスク学習ベースラインを上回る mAcc. を達成しており、特徴の有効な活用が示された。
  • 定性的な結果から、境界の正確性が向上し、特に背景と色が似通った領域でのセグメンテーション誤りが減少していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。