Skip to main content
QUICK REVIEW

[論文レビュー] Unifying Global-Local Representations in Salient Object Detection with Transformer

Sucheng Ren, Qiang Wen|arXiv (Cornell University)|Aug 5, 2021
Visual Attention and Saliency Detection参考文献 52被引用数 13
ひとこと要約

本稿では、浅層部における自己注意機構を活用して空間的詳細を保持すると同時に長距離依存関係を捉えることで、グローバル表現とローカル表現を統合する、ビジョントランスフォーマーに基づくGLSTRを提案する。本手法は、密なスキップ接続と段階的アップサンプリングを備えた深く変換されたデコーダーを採用し、5つのベンチマークで最先端手法と比較して平均12.17%のMAE(平均絶対誤差)の改善を達成した。

ABSTRACT

The fully convolutional network (FCN) has dominated salient object detection for a long period. However, the locality of CNN requires the model deep enough to have a global receptive field and such a deep model always leads to the loss of local details. In this paper, we introduce a new attention-based encoder, vision transformer, into salient object detection to ensure the globalization of the representations from shallow to deep layers. With the global view in very shallow layers, the transformer encoder preserves more local representations to recover the spatial details in final saliency maps. Besides, as each layer can capture a global view of its previous layer, adjacent layers can implicitly maximize the representation differences and minimize the redundant features, making that every output feature of transformer layers contributes uniquely for final prediction. To decode features from the transformer, we propose a simple yet effective deeply-transformed decoder. The decoder densely decodes and upsamples the transformer features, generating the final saliency map with less noise injection. Experimental results demonstrate that our method significantly outperforms other FCN-based and transformer-based methods in five benchmarks by a large margin, with an average of 12.17% improvement in terms of Mean Absolute Error (MAE). Code will be available at https://github.com/OliverRensu/GLSTR.

研究の動機と目的

  • 顔認識のための完全畳み込みネットワーク(FCN)において、グローバルコンテキストとローカル詳細の保持のトレードオフを解消すること。
  • 自己注意機構を用いて、深層ネットワークの各層内でグローバル表現とローカル表現を統合すること。
  • グローバルコンテキストを達成するために深層スタックを必要とするCNNベースのモデルの限界を克服すること。
  • 各トランスフォーマー層が生成する特徴表現の独自性を最大限に活用する新しいデコーダーを設計し、顕著性予測の精度を向上させること。

提案手法

  • 最初の層からグローバル表現を学習できるように、線形変換を用いて画像パッチを処理する純粋なビジョントランスフォーマー・エンコーダーを導入する。
  • 各層が前の層の全特徴マップに注目できるグローバル自己注意機構を採用し、浅層部でも長距離依存関係をモデル化可能にする。
  • すべてのトランスフォーマー層からの特徴を密に接続する、深く変換されたデコーダーを提案し、スケールにわたる豊富なグローバル・ローカル表現を保持する。
  • 異なる段階からの特徴に対して8×、4×、2×の段階的アップサンプリング戦略を採用し、復元処理中のノイズ注入を最小限に抑える。
  • デコーダーステージ間で密なスキップ接続を適用し、各トランスフォーマー層が最終予測に一意に寄与することを保証する。
  • デコーダー内の接続数を制御するための学習可能な密度設定を導入し、特徴統合の効率を最適化する。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーは、顕著物体検出において各層でグローバル表現とローカル表現を効果的に統合できるか。これにより、畳み込み層の深層スタックの必要性が低下するか。
  • RQ2浅層部のトランスフォーマー層における自己注意機構は、どのようにグローバルコンテキストを捉えつつ、ローカル詳細を保持するか。
  • RQ3標準的なスキップ接続と比較して、マルチスケールのトランスフォーマー特徴の密なデコーディングは、顕著マップの精度をどの程度向上させるか。
  • RQ4復元処理における段階的アップサンプリングは、ノイズ注入を低減させ、境界の局所化精度を向上させるか。
  • RQ5純粋なトランスフォーマーに基づくエンコーダーは、顕著物体検出ベンチマークでCNNベースのエンコーダーを上回るか。

主な発見

  • GLSTRは、5つのベンチマークデータセット全体で、最先端手法と比較して平均12.17%のMAE(平均絶対誤差)の改善を達成した。
  • GateNet や BASNet などのSOTAモデルを上回り、DUT-OMRON ではMAEが0.029、DUTS-TE では0.033にまで低下し、従来手法より顕著に優れた結果を示した。
  • 提案された段階的アップサンプリング戦略は、16×アップサンプリングや4×+4×戦略よりも優れており、特に高密度のデコーディング設定下で顕著な優位性を示した。
  • 4つの接続密度を備えた密なデコーダーは一貫した性能向上を示し、特に密度4(最高密度)が最良の結果を達成した。
  • GLSTRの推論速度(RTX 2080Tiで15 FPS)は、他のSOTA手法と同等であり、トランスフォーマーの計算コストを考慮しても実用的であることを示した。
  • 視覚的注意マップから、最初のトランスフォーマー層ですでにグローバルコンテキスト(例:物体全体の構造)を捉えていることが確認された一方で、より深い層ではローカル詳細が保持されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。