Skip to main content
QUICK REVIEW

[論文レビュー] Boosting Salient Object Detection with Transformer-based Asymmetric Bilateral U-Net

Yu Qiu, Yun Liu|arXiv (Cornell University)|Aug 17, 2021
Visual Attention and Saliency Detection参考文献 83被引用数 4
ひとこと要約

本稿では、視覚変換器を用いたグローバルな文脈モデリングと、軽量CNNを用いた局所的詳細学習を統合する、変換器ベースの非対称なバイラテラルU-Net、ABiU-Netを提案する。二重のエンコーダー・デコーダー経路を用い、相互に特徴量を共有することで、複数のベンチマークで最先端の性能を達成し、グローバル・ローカル表現学習の補完的特性により、先行手法を上回る。

ABSTRACT

Existing salient object detection (SOD) methods mainly rely on U-shaped convolution neural networks (CNNs) with skip connections to combine the global contexts and local spatial details that are crucial for locating salient objects and refining object details, respectively. Despite great successes, the ability of CNNs in learning global contexts is limited. Recently, the vision transformer has achieved revolutionary progress in computer vision owing to its powerful modeling of global dependencies. However, directly applying the transformer to SOD is suboptimal because the transformer lacks the ability to learn local spatial representations. To this end, this paper explores the combination of transformers and CNNs to learn both global and local representations for SOD. We propose a transformer-based Asymmetric Bilateral U-Net (ABiU-Net). The asymmetric bilateral encoder has a transformer path and a lightweight CNN path, where the two paths communicate at each encoder stage to learn complementary global contexts and local spatial details, respectively. The asymmetric bilateral decoder also consists of two paths to process features from the transformer and CNN encoder paths, with communication at each decoder stage for decoding coarse salient object locations and fine-grained object details, respectively. Such communication between the two encoder/decoder paths enables AbiU-Net to learn complementary global and local representations, taking advantage of the natural merits of transformers and CNNs, respectively. Hence, ABiU-Net provides a new perspective for transformer-based SOD. Extensive experiments demonstrate that ABiU-Net performs favorably against previous state-of-the-art SOD methods. The code is available at https://github.com/yuqiuyuqiu/ABiU-Net.

研究の動機と目的

  • CNNベースの顕著オブジェクト検出手法が長距離のグローバル依存関係をモデル化する能力に制限を受けることに対処する。
  • 純粋な変換器ベースのSODアプローチにおける局所的表現学習の欠如を克服する。
  • 視覚変換器とCNNの長所を包括的に統合する、統合的アーキテクチャを構築し、顕著性検出を向上させる。
  • 二重パスのエンコーダー・デコーダー構造を設計し、補完的特徴量学習を可能にするための効果的なパス間特徴量通信を実現する。
  • 軽量でエンドツーエンドで学習可能なアーキテクチャにより、標準的なSODベンチマークで最先端の性能を達成する。

提案手法

  • 視覚変換器パス(TEncPath)を用いたグローバル文脈モデリングと、軽量CNNパス(HEncPath)を用いた局所的空間的詳細学習を実現する非対称なバイラテラルエンコーダーを提案する。
  • 各エンコーダーステージでパス間の特徴量連携を導入し、両パスからの特徴量を連結して処理することで、補完的表現学習を強化する。
  • 粗い顕著マップと詳細な情報を別々に復元する、非対称なバイラテラルデコーダーを設計する。それぞれに変換器パス(TDecPath)とCNNパス(HDecPath)を設ける。
  • 変換器パスの最終デコーダーステージにディープスーパービジョンを実装し、過学習を防ぎつつ特徴量の識別性を向上させる。
  • デコーダーでマルチスケールの特徴量統合戦略を採用し、両パスからの階層的特徴量を統合して正確な顕著性予測を実現する。
  • 境界に配慮した損失関数を含む組み合わせ損失関数を用いて、エンドツーエンドでモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1二重パスのエンコーダー・デコーダー構造は、顕著オブジェクト検出において、視覚変換器のグローバルモデリング能力とCNNの局所的特徴量学習能力を効果的に統合できるか?
  • RQ2エンコーダーおよびデコーダーステージにおけるパス間特徴量通信は、単一パスモデルと比較して、特徴量表現をどのように改善するか?
  • RQ3変換器デコーダーパスの最終段階にディープスーパービジョンを適用することで、計算コストを増加させることなく、特徴量の識別性がどのように向上するか?
  • RQ4ImageNetの事前学習なしで軽量CNNパスはどのように性能を発揮するか?また、検出精度に有意義な貢献を果たすか?
  • RQ5提案されたABiU-Netの失敗モードは何か?オブジェクトサイズ、顕著性の曖昧さ、または背景の複雑さとどのように関係しているか?

主な発見

  • ABiU-Netは、DUT-OMRON、DUTS-TE、ECSSD、PASCAL-S、HKU-ISの5つの主要なSODベンチマークで、それぞれ0.891、0.857、0.913、0.824、0.876の平均Fスコアを達成し、新たな最先端性能を記録した。
  • アブレーションスタディにより、非対称なバイラテラル設計が単一パスモデル(例:TED+DSやHED+DS)を著しく上回ることが確認され、グローバルおよびローカル学習の補完的利点が裏付けられた。
  • ハイパーパramータの変動に対して頑健であり、さまざまなチャネル設定において僅かな性能の変動しか示さないため、強力な一般化能力を示した。
  • 変換器デコーダーパスの最終段階にディープスーパービジョンを適用した場合が最も高い性能を示し、特徴量学習の有効性が裏付けられた。
  • 失敗事例の分析から、極めて小さなオブジェクトや目立たないオブジェクトの検出に限界があること、類似した意味的コンテンツを含む複雑な背景の処理に困難を示すこと、曖昧な正解アノテーションの影響を受けることが判明した。
  • 軽量CNNパスはImageNetの事前学習なしでも良好な性能を発揮し、限定的な事前学習データでもアーキテクチャ自体の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。