Skip to main content
QUICK REVIEW

[論文レビュー] Instance-Level Relative Saliency Ranking with Graph Reasoning

Nian Liu, Long Li|arXiv (Cornell University)|Jul 8, 2021
Visual Attention and Saliency Detection参考文献 87被引用数 4
ひとこと要約

本論文は、インスタンスレベルの相対的注目度順序付けのための最初のエンド・ツー・エンドモデルを提案する。インスタンスセグメンテーションに改良されたMask R-CNNを組み合わせ、局所的コントラスト、グローバルな文脈、インスタンス間相互作用、および意味的事前知識を統合するグラフ推論モジュールを導入し、相対的注目度順位を推定する。本手法は、新しい評価指標を備えた新規データセットにおいて最先端の性能を達成し、アダプティブ画像リターゲティングなどの応用分野において優れた正確性と実用性を示している。

ABSTRACT

Conventional salient object detection models cannot differentiate the importance of different salient objects. Recently, two works have been proposed to detect saliency ranking by assigning different degrees of saliency to different objects. However, one of these models cannot differentiate object instances and the other focuses more on sequential attention shift order inference. In this paper, we investigate a practical problem setting that requires simultaneously segment salient instances and infer their relative saliency rank order. We present a novel unified model as the first end-to-end solution, where an improved Mask R-CNN is first used to segment salient instances and a saliency ranking branch is then added to infer the relative saliency. For relative saliency ranking, we build a new graph reasoning module by combining four graphs to incorporate the instance interaction relation, local contrast, global contrast, and a high-level semantic prior, respectively. A novel loss function is also proposed to effectively train the saliency ranking branch. Besides, a new dataset and an evaluation metric are proposed for this task, aiming at pushing forward this field of research. Finally, experimental results demonstrate that our proposed model is more effective than previous methods. We also show an example of its practical usage on adaptive image retargeting.

研究の動機と目的

  • 現存する注目度検出モデルが、現実のシーンにおいて注目度にばらつきを持つオブジェクトを均等に扱うというギャップに対処すること。
  • 同時にセグメンテーションと相対的注目度順位推定を実行できる統合的でエンド・ツー・エンドのフレームワークを構築すること。
  • 局所的、グローバルな、意味的特徴を含む、複数レベルの文脈的手がかり(局所的コントラスト、グローバルな文脈、インスタンス間相互作用、意味的事前知識)を効果的に統合して、相対的注目度順序を正確に予測すること。
  • インスタンスレベルの相対的注目度順序付けに特化した新規データセットと評価指標を提案し、今後の研究を支援すること。

提案手法

  • インスタンスセグメンテーションのバックボーンとして、注目オブジェクトの正確なマスクを提供する改良されたMask R-CNNを採用する。
  • インスタンス相互作用、局所的コントラスト、グローバルコントラスト、およびハイレベルな意味的事前知識の4つのグラフを統合した、新規のグラフ推論モジュールを導入する。
  • メッセージパッシングを通じて複数レベルの特徴を統合し、注目インスタンス間の複雑な関係性をモデル化する。
  • 相対的順位順序の正確性を最適化するため、注目度順位分岐を監督する新しい損失関数を設計する。
  • 2段階の訓練プロトコルを採用:まずインスタンスセグメンテーションを実行し、その後、統合最適化により注目度順位を推定する。
  • 注目度順位は各インスタンスごとに連続スコアとして予測され、オブジェクトの重要性の相対的比較が可能になる。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドのディープラーニングモデルは、正確なインスタンスレベルの注目度セグメンテーションと相対的注目度順位推定を同時に実行できるか?
  • RQ2局所的コントラスト、グローバルな文脈、インスタンス間相互作用、意味的事前知識といった複数レベルの文脈的手がかりを、相対的注目度予測に効果的に統合する方法は何か?
  • RQ3絶対的注目度の教師信号に依存せずに、正確な相対的順位推定を学習するのに最適な損失関数の設計は何か?
  • RQ4提案されたグラフ推論モジュールは、逐次的アテンションやピクセル単位の回帰と比較して、順位推定性能をどのように向上させるか?
  • RQ5提案されたモデルは、アダプティブ画像リターゲティングなどの実世界のタスクに効果的に応用できるか?

主な発見

  • 提案モデルは新規に導入されたデータセットにおいて最先端の性能を達成し、セグメンテーションと順位推定の両方で既存手法を上回った。
  • グラフ推論モジュールは、インスタンス間の関係性とマルチスケールの文脈を効果的にモデル化することで、順位推定性能を顕著に向上させた。
  • 提案された損失関数は、標準的な回帰損失と比較して、相対的順位順序の最適化をより効果的に行うことができ、注目度順序の予測精度が向上した。
  • モデルは、大規模なスケールの縮小においても最も注目度の高いオブジェクトを保持し、重要度が低いものを除去するという点で、アダプティブ画像リターゲティングにおいて実用的であることが示された。
  • アブレーションスタディにより、グラフ推論モジュールの各構成要素の重要性が確認され、完全なモデルが最良の結果をもたらした。
  • 新規データセットと評価指標が、インスタンスレベルの相対的注目度順序付け性能を測定するのに有効であることが示され、今後のベンチマークに貢献する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。