Skip to main content
QUICK REVIEW

[論文レビュー] Depth Quality-Inspired Feature Manipulation for Efficient RGB-D Salient Object Detection

Wenbo Zhang, Ge-Peng Ji|arXiv (Cornell University)|Jul 5, 2021
Visual Attention and Saliency Detection参考文献 64被引用数 4
ひとこと要約

本論文では、境界整合性に基づいて深さ特徴量の重みを動的に制御するDepth Quality-Inspired Feature Manipulation (DQFM)を用いてクロスモーダル統合を強化し、全体的注意を適用して耐性を向上させる軽量なRGB-D顕著オブジェクト検出モデル、DFM-Netを提案する。DFM-Netは、特徴量の統合を深さ品質に基づいて制御し、全体的注意を用いることで、効率性と精度のトレードオフを改善する。モデルサイズがたった8.5MBで、CPU上での推論時間が140msという、最先端の精度を達成しており、従来の効率的モデルよりも2.2倍速い。これは、特化した深さバックボーンと2段階のデコーダーを統合することで実現された。

ABSTRACT

RGB-D salient object detection (SOD) recently has attracted increasing research interest by benefiting conventional RGB SOD with extra depth information. However, existing RGB-D SOD models often fail to perform well in terms of both efficiency and accuracy, which hinders their potential applications on mobile devices and real-world problems. An underlying challenge is that the model accuracy usually degrades when the model is simplified to have few parameters. To tackle this dilemma and also inspired by the fact that depth quality is a key factor influencing the accuracy, we propose a novel depth quality-inspired feature manipulation (DQFM) process, which is efficient itself and can serve as a gating mechanism for filtering depth features to greatly boost the accuracy. DQFM resorts to the alignment of low-level RGB and depth features, as well as holistic attention of the depth stream to explicitly control and enhance cross-modal fusion. We embed DQFM to obtain an efficient light-weight model called DFM-Net, where we also design a tailored depth backbone and a two-stage decoder for further efficiency consideration. Extensive experimental results demonstrate that our DFM-Net achieves state-of-the-art accuracy when comparing to existing non-efficient models, and meanwhile runs at 140ms on CPU (2.2$ imes$ faster than the prior fastest efficient model) with only $\sim$8.5Mb model size (14.9% of the prior lightest). Our code will be available at https://github.com/zwbx/DFM-Net.

研究の動機と目的

  • モバイルデプロイメントを想定したRGB-D顕著オブジェクト検出における効率性と精度のトレードオフを解消すること。
  • 特に低品質またはノイズの多い深さマップにおいて、深さ品質がモデルの精度に与える影響が顕著であることを特定すること。
  • 深さ品質に基づいて深さ特徴量の統合を明示的に制御するメカニズムを提案し、耐性を向上させること。
  • 最小限のパラメータ数と高速な推論速度を実現する、軽量で効率的なアーキテクチャを設計すること。
  • 性能を損なわずに計算コストをさらに削減するため、特化した深さバックボーンと2段階のデコーダーを統合すること。

提案手法

  • 境界整合性(BA)を用いて深さ品質を評価し、深さ特徴量に適応的な重みを割り当てるゲーティング機構として、Depth Quality-Inspired Feature Manipulation(DQFM)を提案する。
  • RGB特徴量との境界整合性に基づき、高品質な深さ特徴量に高い注目を向けるように動的に重みを割り当てるDepth Quality Weighting(DQW)を導入する。
  • 顕著領域を強化するため、学習可能な注目メカニズムを用いて高レベルの深さ特徴量を再キャリブレーションするDepth-wise Holistic Attention(DHA)を実装する。
  • 深さデータ処理に最適化された特化した深さバックボーン(TDB)を設計し、モデルサイズをMobileNet-V2の6.9MBから0.9MBにまで削減した。
  • 段階的に予測を精緻化する2段階のデコーダーを採用し、効率性を維持しながら特徴表現を向上させる。
  • DQWおよびDHAのパラメータに対して、複数変数戦略を用いて、特徴レベルごとに階層的な品質重みと注目マップの適応を可能にした。
Figure 1. Average probability distributions (solid curves) of edge Dice coefficients computed from “Good quality”, “Bad quality”, and “Mismatch” subsets (10 times random sampling), as well as the probability distributions (dash curves) of the whole STERE and SIP datasets. The right images show three
Figure 1. Average probability distributions (solid curves) of edge Dice coefficients computed from “Good quality”, “Bad quality”, and “Mismatch” subsets (10 times random sampling), as well as the probability distributions (dash curves) of the whole STERE and SIP datasets. The right images show three

実験結果

リサーチクエスチョン

  • RQ1深さ品質を、RGB-D顕著オブジェクト検出におけるクロスモーダル統合を改善する信号として効果的に活用できるか?
  • RQ2軽量モデルは、パラメータ数と推論時間を著しく削減しながらも、高い精度を維持できるか?
  • RQ3RGBと深さ特徴量の境界整合性が、深さ品質および検出性能とどの程度相関しているか?
  • RQ4特化した軽量深さバックボーンは、MobileNet-V2のような標準バックボーンを上回って、SODのための深さ特徴量抽出を実現できるか?
  • RQ5段階的な精緻化を実現する2段階のデコーダーは、計算コストを増加させることなく、検出精度を向上させられるか?

主な発見

  • DFM-Netは、標準的なRGB-D SODベンチマークにおいて、軽量モデルの中で最先端の精度を達成し、従来の効率的モデルを上回った。
  • CPU上での推論時間は140msであり、従来で最も速かった効率的モデルよりも2.2倍速い。
  • DFM-Netのモデルサイズはたった8.5MBであり、従来で最も軽量なモデルの14.9%にまで削減された。
  • 特化した深さバックボーン(TDB)により、モデルサイズが0.9MBにまで削減され、MobileNet-V2と比較して87%の削減が達成された一方で、精度も向上した。
  • 除去実験の結果、DQWおよびDHAの両方が不可欠であることが確認された:DQWは低品質な深さに対する耐性を向上させ、DHAは2倍のF_rec演算を最適に活用して特徴再キャリブレーションを強化した。
  • DQWおよびDHAのパラメータに対して複数変数戦略を採用することで、ネットワークの柔軟性が向上し、単一変数の代替手法よりも優れた性能が得られた。
Figure 2. Block diagram of the proposed DFM-Net . Best view in color.
Figure 2. Block diagram of the proposed DFM-Net . Best view in color.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。