Skip to main content
QUICK REVIEW

[論文レビュー] RGB-D Saliency Detection via Cascaded Mutual Information Minimization

Jing Zhang, Deng-Ping Fan|arXiv (Cornell University)|Sep 15, 2021
Visual Attention and Saliency Detection参考文献 50被引用数 8
ひとこと要約

本論文は、RGBと深度モダリティの特徴間の相互情報量を最小化することで、RGBと深度の相補的情報を明示的にモデル化する、段階的でマルチステージの学習フレームワークを提案する。各段階で相互情報量最小化を正則化子として適用することで、冗長性を低減し、特徴の多様性を向上させ、ベンチマークデータセットで最先端の性能を達成するとともに、完全/弱い/教師なし学習をサポートする多様なアノテーションを備えた、最大のRGB-D顕著性データセットであるCOME15Kを提供する。

ABSTRACT

Existing RGB-D saliency detection models do not explicitly encourage RGB and depth to achieve effective multi-modal learning. In this paper, we introduce a novel multi-stage cascaded learning framework via mutual information minimization to "explicitly" model the multi-modal information between RGB image and depth data. Specifically, we first map the feature of each mode to a lower dimensional feature vector, and adopt mutual information minimization as a regularizer to reduce the redundancy between appearance features from RGB and geometric features from depth. We then perform multi-stage cascaded learning to impose the mutual information minimization constraint at every stage of the network. Extensive experiments on benchmark RGB-D saliency datasets illustrate the effectiveness of our framework. Further, to prosper the development of this field, we contribute the largest (7x larger than NJU2K) dataset, which contains 15,625 image pairs with high quality polygon-/scribble-/object-/instance-/rank-level annotations. Based on these rich labels, we additionally construct four new benchmarks with strong baselines and observe some interesting phenomena, which can motivate future model design. Source code and dataset are available at "https://github.com/JingZhang617/cascaded_rgbd_sod".

研究の動機と目的

  • 既存のRGB-D顕著性検出モデルにおいて、RGBと深度モダリティ間の相補的情報を明示的にモデル化する欠如に対処すること。
  • モダリティ間の冗長性を制約しないインプリシットな統合戦略の限界を克服すること。
  • RGB-D顕著性モデルの強固な訓練と評価を支援する大規模で多様かつ豊富にアノテートされたデータセットを提供すること。
  • 完全教師あり、弱教師あり、半教師ありRGB-D顕著性検出のための新しいベンチマークを確立すること。

提案手法

  • 各段階で相互情報量最小化を正則化子として適用することで、RGBと深度特徴間の冗長性を低減する、マルチステージの段階的学習フレームワークを提案する。
  • 各モダリティ(RGBおよび深度)の特徴を低次元ベクトルにマップし、それらの相互情報量を最小化することで、相補的学習を促進する。
  • 共通のエンコーダ・デコーダアーキテクチャに、モダリティ固有のエンコーダとクロスアテンション統合モジュールを組み合わせ、モダリティ固有の表現を保持しながら特徴を統合する。
  • 対照的学習の目的関数を用いて相互情報量最小化を実装し、外観特徴と幾何的特徴の分離を促進する。
  • Holo50Kから再アノテートすることで、15,625組の画像ペアを含み、ポリゴン、スクリッチ、インスタンス、オブジェクト、順位レベルのアノテーションを持つ新しいデータセットCOME15Kを構築する。
  • 標準、ステレオスコピック、スクリッチ/ポリゴン教師あり、および半教師あり学習の4つの新しいベンチマークを確立し、それぞれに強力なベースラインを提供する。

実験結果

リサーチクエスチョン

  • RQ1段階的ディープラーニングフレームワークにおけるRGBと深度特徴間の冗長性を、相互情報量最小化が効果的に低減できるか?
  • RQ2相互情報量最小化による相補的情報を明示的にモデル化することで、インプリシットな統合戦略と比較して性能がどのように向上するか?
  • RQ3COME15Kのような大規模で多様かつ多段階アノテートされたRGB-Dデータセットは、モデルの一般化性能とベンチマーク評価にどの程度寄与するか?
  • RQ4提案されたフレームワークは、最小限のアーキテクチャ変更で、弱教師ありおよびステレオスコピック顕著性検出タスクに一般化可能か?

主な発見

  • 提案された段階的相互情報量最小化フレームワークは、標準RGB-D顕著性検出ベンチマークで最先端の性能を達成し、COME15K-NormalおよびCOME15K-Difficultテストセットの両方で、既存の手法を上回った。
  • 新規のCOME15Kデータセットにおける最先端モデル間の性能差は、モデルのロバストネスと一般化性能を評価するうえで、このデータセットの有効性を示している。
  • COME15Kで訓練されたステレオスコピック顕著性検出ベースラインは、ハードテストセットで$F_{\beta}$ = 0.812を達成し、このデータセットが暗黙的な幾何モデリングの可能性を秘めていることを示している。
  • スクリッチ教師ありベースラインは$S_{\alpha}$ = 0.855を達成し、ポリゴン教師ありベースラインは0.861に達した。これは、より豊富な監視情報が予測の構造的一致性を向上させることを示している。
  • COME15Kに含まれる5,000枚のラベルなし画像のおかげで、効果的な半教師あり学習が可能となり、今後の自己教師ありおよび弱教師あり学習研究を支援する。
  • 分析の結果、既存のデータセットは低次元の多様性と繰り返しのシーンを抱えるが、COME15Kは著しく多様で高品質なデータによりこれを緩和していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。