Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty Inspired RGB-D Saliency Detection

Jing Zhang, Deng-Ping Fan|arXiv (Cornell University)|Sep 7, 2020
Visual Attention and Saliency Detection参考文献 86被引用数 7
ひとこと要約

本論文は、潜在変数を用いて人間のアノテーションの不確実性をモデル化する生成的モデルを備えた、RGB-Dサリエンシー検出のための最初の確率的フレームワークを提案する。潜在変数の推論に条件付き変分オートエンコーダー(CVAE)または交互バックプロパゲーション(ABP)を採用することで、多様で確率的なサリエンシー予測を生成し、6つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

We propose the first stochastic framework to employ uncertainty for RGB-D saliency detection by learning from the data labeling process. Existing RGB-D saliency detection models treat this task as a point estimation problem by predicting a single saliency map following a deterministic learning pipeline. We argue that, however, the deterministic solution is relatively ill-posed. Inspired by the saliency data labeling process, we propose a generative architecture to achieve probabilistic RGB-D saliency detection which utilizes a latent variable to model the labeling variations. Our framework includes two main models: 1) a generator model, which maps the input image and latent variable to stochastic saliency prediction, and 2) an inference model, which gradually updates the latent variable by sampling it from the true or approximate posterior distribution. The generator model is an encoder-decoder saliency network. To infer the latent variable, we introduce two different solutions: i) a Conditional Variational Auto-encoder with an extra encoder to approximate the posterior distribution of the latent variable; and ii) an Alternating Back-Propagation technique, which directly samples the latent variable from the true posterior distribution. Qualitative and quantitative results on six challenging RGB-D benchmark datasets show our approach's superior performance in learning the distribution of saliency maps. The source code is publicly available via our project page: https://github.com/JingZhang617/UCNet.

研究の動機と目的

  • 現在のRGB-Dサリエンシー検出手法で確定的と見なされている、人間によるアノテーションに内在する主観性と不確実性に対処すること。
  • 単一の確定的出力ではなく、人間の知覚のばらつきを反映するサリエンシー地図の分布をモデル化すること。
  • ラベル付けのばらつきから学習することで、潜在変数を用いて多様なサリエンシー予測を生成する生成的フレームワークを開発すること。
  • 不確実性モデリングのための2つの推論戦略——補助エンコーダーを備えたCVAEと勾配ベースのMCMCを用いたABP——の有効性を評価すること。
  • 提案フレームワークを標準的なRGBサリエンシー検出に拡張し、アーキテクチャの変更なしに汎用性と最先端の性能を示すこと。

提案手法

  • エンコーダ・デコーダアーキテクチャを用いて、入力のRGB-D画像と潜在変数をマッピングし、確率的サリエンシー予測を生成する生成的フレームワークを提案する。
  • 潜在変数の事後分布を近似するために、追加の推論ネットワークを備えた条件付き変分オートエンコーダー(CVAE)を採用する。
  • 勾配ベースのマルコフ連鎖モンテカルロ(MCMC)を用いて、真の事後分布から潜在変数を直接サンプリングする、交替バックプロジェクション(ABP)技術を導入する。
  • 複数の予測を統合して1つの高精度な確定的出力に変換するサリエンシー共通モジュールを用い、人間の合意形成プロセスを模倣する。
  • 入力モalityを変更するだけで、RGB-DおよびRGBサリエンシー検出の両方で同じネットワークアーキテクチャを適用することで、モデルの柔軟性を示す。
  • 再構成損失と adversarial 損失の組み合わせを用いて、エンド・トゥ・エンドで学習することで、生成されたサリエンシー地図の品質と多様性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1人間のサリエンシー アノテーションにおける不確実性をモデル化することで、確定的アプローチと比較して、よりロバストで現実的なサリエンシー予測が得られるか?
  • RQ2ラベル付けのばらつきを表す潜在変数を介して、深層生成モデルがどのようにサリエンシー地図の分布を効果的に捉えることができるか?
  • RQ3サリエンシー検出における不確実性モデリングにおいて、CVAEに基づく推論モデルとABPに基づく推論手法の相対的な利点とトレードオフは何か?
  • RQ4提案されたフレームワークは、アーキテクチャの変更なしに、標準的なRGBサリエンシー検出に一般化可能か?
  • RQ5モデルが生成する多様なサリエンシー予測は、人間のアノテーションに内在する真の不確実性をどの程度反映しているか?

主な発見

  • 提案手法である Ours_CVAE および Ours_ABP は、6つの挑戦的なRGB-Dベンチマークデータセットで最先端の性能を達成し、Ours_ABP は大多数の指標で既存手法を上回った。
  • DUTS-TO データセットでは、Ours_ABP が平均Fスコア 0.957、Diceスコア 0.949、E-measure 0.917 を達成し、以前のSOTA手法を上回った。
  • 定性的な結果から、複雑なシーンにおいてもモデルが多様なサリエンシー予測を生成していることが示され、人間のアノテーションにおける不確実性を反映している。
  • サリエンシー共通モジュールは、複数の確率的予測を効果的に統合し、真のアノテーションプロセスと同等の品質の確定的出力に変換した。
  • RGBオンリーモードに拡張した場合、同じフレームワークはECSSD、DUTS、HKU-ISなど、他のベンチマークでも最先端の性能を維持したが、アーキテクチャの変更は一切行わなかった。
  • ABPに基づく推論手法はCVAEに比べてわずかに高い性能を示したが、1回のフォワードパスあたり複数回のMCMCステップを要するため、学習時間が長くなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。