Skip to main content
QUICK REVIEW

[論文レビュー] HSCS: Hierarchical Sparsity Based Co-saliency Detection for RGBD Images

Runmin Cong, Jianjun Lei|arXiv (Cornell University)|Nov 16, 2018
Visual Attention and Saliency Detection参考文献 67被引用数 4
ひとこと要約

本稿では、RGBD画像の階層的スパarsityに基づく共通サリエンシー検出手法HSCSを提案する。本手法は、画像間の関係をモデル化するためにグローバルおよびペアワイズのスパarsity再構成を活用し、滑らかさと一貫性を向上させるためにエネルギー関数の最適化を組み合わせる。2つのRGBD共通サリエンシーベンチマークで最先端の性能を達成し、定量的・定性的に従来手法を上回り、深度情報を組み込むことでF-measureが8.4%も向上する。

ABSTRACT

Co-saliency detection aims to discover common and salient objects in an image group containing more than two relevant images. Moreover, depth information has been demonstrated to be effective for many computer vision tasks. In this paper, we propose a novel co-saliency detection method for RGBD images based on hierarchical sparsity reconstruction and energy function refinement. With the assistance of the intra saliency map, the inter-image correspondence is formulated as a hierarchical sparsity reconstruction framework. The global sparsity reconstruction model with a ranking scheme focuses on capturing the global characteristics among the whole image group through a common foreground dictionary. The pairwise sparsity reconstruction model aims to explore the corresponding relationship between pairwise images through a set of pairwise dictionaries. In order to improve the intra-image smoothness and inter-image consistency, an energy function refinement model is proposed, which includes the unary data term, spatial smooth term, and holistic consistency term. Experiments on two RGBD co-saliency detection benchmarks demonstrate that the proposed method outperforms the state-of-the-art algorithms both qualitatively and quantitatively.

研究の動機と目的

  • 複数のRGBD画像において共通のサリエントなオブジェクトを検出する課題に取り組むこと。特に、従来の共通サリエンシー手法では深度情報が十分に活用されていない。
  • 画像グループ間のグローバルおよびローカルな関係を捉えることで、画像間対応関係のモデリングを向上させること。
  • エネルギー関数の最適化モデルを用いて、画像内での滑らかさと画像間の一貫性を向上させること。
  • マッチングや伝搬に基づく手法と比較して計算コストを低減する効率的な共通サリエンシー検出フレームワークの構築。

提案手法

  • グローバルスパarsity再構成に順位付けスキームを組み合わせた階層的スパarsity再構成モデルを提案し、画像グループ全体にわたる共通のフォアグラウンド特徴を捉える。
  • ペアワイズスパarsity再構成を用いて、専用のペアワイズフォアグラウンド辞書を用いて画像ペア間のローカルな対応関係をモデル化する。
  • 単一データ項、空間的滑らかさ項、包括的一致性項を統合したマルチコンポonentエネルギー関数を導入し、サリエンシーマップの最適化を図る。
  • 背景領域をフィルタリングすることで辞書学習のロバスト性を向上させるため、順位付けスキームを用いてフォアグラウンドシードを選択する。
  • 深度情報は、画像間対応関係モデリングにおける制約として、および最適化段階でのカラー特徴補完として用いる。
  • スーパーピクセルを用いて画像を分割し、再構成精度とバックグラウンドノイズのバランスを最適化するための初期フォアグラウンドシード数を最適化する。

実験結果

リサーチクエスチョン

  • RQ1どのようにしてRGBD画像グループの共通サリエンシー検出に深度情報を効果的に統合することで、精度を向上させることができるか?
  • RQ2グローバルおよびペアワイズ再構成を組み合わせた階層的スパarsityモデルが、画像間対応関係モデリングに与える影響は何か?
  • RQ3提案されたエネルギー関数の最適化モデルは、画像内での滑らかさと画像間の一貫性をどのように向上させるか?
  • RQ4フォアグラウンドシード選択のための順位付けスキームが、バックグラウンド干渉に対してどれほどロバスト性を向上させるか?
  • RQ5提案手法は、RGBDデータセットにおける既存の最先端の共通サリエンシー検出手法と比較して、効率性と正確性の両面でどの程度優れているか?

主な発見

  • 深度情報の組み込みにより、RGBD CoSal150データセットでF-measureが相対的に8.4%向上し、共通サリエンシー検出の精度向上に有効であることが示された。
  • フォアグラウンドシード選択のための順位付けスキームは、背景領域を効果的にフィルタリングすることで、定量的・定性的な性能向上をもたらした。
  • 初期フォアグラウンドシードの最適数は1画像あたり40個であり、それ以上になるとバックグラウンドノイズが増加し性能が低下する。
  • 本手法は1画像あたり平均8.29秒の実行時間を達成し、MCLP(41.03秒)やICS(42.67秒)といったマッチングベースの手法と比較して顕著に高速である。
  • スーパーピクセルの最適数は400であるが、性能はこの範囲で安定しており、このパラメータに対して低い感度を示している。
  • 提案されたHSCS手法は、RGBD CoSal150およびNYU-DepthV2の両方の共通サリエンシー検出ベンチマークで最先端の性能を達成し、定量的・定性的な両評価で既存手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。