Skip to main content
QUICK REVIEW

[論文レビュー] Squeeze-and-Attention Networks for Semantic Segmentation

Zilong Zhong, Zhong Qiu Lin|arXiv (Cornell University)|Sep 8, 2019
Advanced Neural Network Applications参考文献 44被引用数 20
ひとこと要約

本論文は、画素ごとの予測と画素群の注目を分離する新しいセマンティックセグメンテーションアーキテクチャであるSqueeze-and-Attention Networks (SANet)を提案する。非局所的でダウンサンプリングされた注目マップを通じて空間的・チャネル的依存関係を学ぶsqueeze-and-attention (SA)モジュールを導入することで、重い空洞畳み込みに依存せずに特徴表現を向上させ、COCO事前学習なしでPASCAL VOCで83.2%のmIoU、PASCAL Contextで54.4%を達成した。

ABSTRACT

The recent integration of attention mechanisms into segmentation networks improves their representational capabilities through a great emphasis on more informative features. However, these attention mechanisms ignore an implicit sub-task of semantic segmentation and are constrained by the grid structure of convolution kernels. In this paper, we propose a novel squeeze-and-attention network (SANet) architecture that leverages an effective squeeze-and-attention (SA) module to account for two distinctive characteristics of segmentation: i) pixel-group attention, and ii) pixel-wise prediction. Specifically, the proposed SA modules impose pixel-group attention on conventional convolution by introducing an 'attention' convolutional channel, thus taking into account spatial-channel inter-dependencies in an efficient manner. The final segmentation results are produced by merging outputs from four hierarchical stages of a SANet to integrate multi-scale contexts for obtaining an enhanced pixel-wise prediction. Empirical experiments on two challenging public datasets validate the effectiveness of the proposed SANets, which achieves 83.2% mIoU (without COCO pre-training) on PASCAL VOC and a state-of-the-art mIoU of 54.4% on PASCAL Context.

研究の動機と目的

  • セマンティックセグメンテーションにおける画素グループ化というあまり注目されていないサブタスクに取り組み、画素ごとの予測と補完的であることを目的とする。
  • グリッド構造の畳み込みカーネルが空間的特徴学習を制限するという限界を克服することを目的とする。
  • 重い空洞畳み込みに依存せずに、非局所的な空間的依存関係を捉える効率的な注目メカニズムを設計することを目的とする。
  • 階層的段階におけるマルチスケールの文脈的特徴を統合し、より良い密予測を実現することを目的とする。
  • ベンチマーク間で良好に一般化する、軽量かつ強力なセグメンテーションネットワークを開発することを目的とする。

提案手法

  • 平均プーリングを用いて特徴マップをダウンサンプリングし、空間的構造を保持しながら注目マスクを生成するsqueeze-and-attention (SA)モジュールを提案する。
  • 空間的およびチャネルワイドの依存関係に基づいて特徴チャネルを再キャリブレーションする学習可能な重みを生成するための注目畳み込みを導入する。
  • 四つの階層的バックボーン段階の出力にSAモジュールをヘッドユニットとして統合する。
  • 強力な特徴抽出能力を活かすために、空洞ResNetおよびEfficientNetをバックボーンとして使用する。
  • SAモジュールからのマルチスケール特徴を統合し、物体境界検出とシーン解析を向上させる。
  • EncNetのような複雑なモジュールを避けるシンプルで効果的なアーキテクチャを採用し、計算コストを低減しながらパフォーマンスを維持する。

実験結果

リサーチクエスチョン

  • RQ1セマンティックセグメンテーションは、画素ごとの予測と画素群の注目という2つの独立したサブタスクに効果的に分解可能か?
  • RQ2空洞畳み込みに依存せずに、非局所的な空間的依存関係を捉える注目メカニズムはどのように設計できるか?
  • RQ3軽量な注目モジュールは、モデルの複雑さを低減しつつセグメンテーションパフォーマンスを向上させることができるか?
  • RQ4階層的なSAモジュールを通じてマルチスケール特徴を統合することで、境界および文脈理解が向上するか?
  • RQ5提案されたSANetは、COCO事前学習なしで、挑戦的なベンチマークで最先端のパフォーマンスを達成できるか?

主な発見

  • SANetはCOCO事前学習なしでPASCAL VOC 2012で83.2%のmIoUを達成し、RefineNet や PSPNet を含む以前のモデルを上回った。
  • PASCAL Contextでは、54.4%の最先端のmIoUを達成し、長尾分布や複雑なシーンにおける強力な一般化能力を示した。
  • COCO事前学習ありでは86.1%のmIoUを達成し、PSPNetと同等のトップパフォーマンスを発揮し、より軽量なResNet101バックボーンを用いてもRefineNetを上回った。
  • SANetはたった55.5Mパラメータと204.7G MACsで、SDN(238.5Mパラメータ)のような重いモデルよりもはるかに少ないながらも、複数の大きなモデルを上回るmIoUを達成した。
  • 定性的な結果から、SANetはベースラインのFCNや他のモデルと比較して、より鋭い物体境界とより正確なパーサーを生成することがわかった。
  • SAモジュールは計算的に効率的で効果的であり、EncNetのエンコーディングモジュールを精度とパラメータ効率の両面で上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。