Skip to main content
QUICK REVIEW

[論文レビュー] Visual Attention Network

Meng-Hao Guo, Cheng-Ze Lu|arXiv (Cornell University)|Feb 20, 2022
Advanced Neural Network Applications被引用数 14
ひとこと要約

本稿では、2次元画像構造を保持し、計算複雑性を低減するとともにチャネルごとの適応性を可能にする線形自己注意機構である Large Kernel Attention (LKA) を提案する。LKA を基盤に構築された Visual Attention Network (VAN) は、ImageNet、COCO、ADE20K などのベンチマークで、類似サイズのビジョン変換器および畳み込みニューラルネットワーク(CNN)を上回る最先端の性能を達成し、画像分類、物体検出、セグメンテーションの各タスクで優れた結果を示した。

ABSTRACT

While originally designed for natural language processing tasks, the self-attention mechanism has recently taken various computer vision areas by storm. However, the 2D nature of images brings three challenges for applying self-attention in computer vision. (1) Treating images as 1D sequences neglects their 2D structures. (2) The quadratic complexity is too expensive for high-resolution images. (3) It only captures spatial adaptability but ignores channel adaptability. In this paper, we propose a novel linear attention named large kernel attention (LKA) to enable self-adaptive and long-range correlations in self-attention while avoiding its shortcomings. Furthermore, we present a neural network based on LKA, namely Visual Attention Network (VAN). While extremely simple, VAN surpasses similar size vision transformers(ViTs) and convolutional neural networks(CNNs) in various tasks, including image classification, object detection, semantic segmentation, panoptic segmentation, pose estimation, etc. For example, VAN-B6 achieves 87.8% accuracy on ImageNet benchmark and set new state-of-the-art performance (58.2 PQ) for panoptic segmentation. Besides, VAN-B2 surpasses Swin-T 4% mIoU (50.1 vs. 46.1) for semantic segmentation on ADE20K benchmark, 2.6% AP (48.8 vs. 46.2) for object detection on COCO dataset. It provides a novel method and a simple yet strong baseline for the community. Code is available at https://github.com/Visual-Attention-Network.

研究の動機と目的

  • コンピュータビジョンにおける自己注意機構の限界、すなわち 2次元画像を 1次元シーケンスとして扱うこと、2次関数的複雑性、チャネルごとの適応性の欠如を解消すること。
  • 畳み込みと自己注意の利点を統合することで、視覚タスクに特化したより効率的かつ効果的な注意機構を設計すること。
  • 複数の視覚タスクで最先端の性能を達成する、シンプルだが強力なビジョンバックボーン、Visual Attention Network (VAN) を提案すること。
  • 自己注意機構が視覚モデルにおいて代替不能であるという仮定に挑戦し、優れた代替手段を示すこと。

提案手法

  • 大規模な畳み込みカーネルを用いて長距離依存関係をモデル化しつつ、線形の複雑性を維持する線形自己注意機構である Large Kernel Attention (LKA) を提案する。
  • 入力特徴に基づいて動的に調整される注意重みを学習することで、空間的およびチャネルごとの適応性を明示的にモデル化する。
  • マルチヘッド自己注意や位置埋め込みを必要としないシンプルな順方向ニューラルネットワークアーキテクチャに LKA を統合し、Visual Attention Network (VAN) を構築する。
  • 深さ方向分離畳み込みとチャネルごとのスケーリングを設計することで、効率性とパラメータ効率性を維持する。
  • 特定のタスクに特化したアーキテクチャの変更なしに、標準的な最適化プロトコルに従い、標準的なビジョンベンチマークで VAN をエンドツーエンドで訓練する。
  • 畳み込みの 2次元インダクティブバイアスと、注意機構によるグローバルモデリング能力を、学習可能なカーネルベースの注意機構を通じて統合する。

実験結果

リサーチクエスチョン

  • RQ1線形自己注意機構は、視覚タスクにおける長距離モデリングを実現しつつ、2次元空間構造を保持できるか?
  • RQ2チャネルごとの適応性を組み込んだ自己注意機構は、視覚ベンチマークで標準的な自己注意機構を上回る性能を発揮するか?
  • RQ3新しい注意モジュールに基づくシンプルなネットワークは、アーキテクチャの複雑さを伴わず、最先端のビジョン変換器および CNN を上回る性能を達成できるか?
  • RQ4提案された LKA メカニズムは、高解像度画像に対して標準的な自己注意機構よりも効率的かつ効果的か?
  • RQ5トランスフォーマーでないバックボーンが、多様な視覚タスクで最先端の性能を達成できるか?

主な発見

  • VAN-B6 は ImageNet-1K でトップ-1正確度 87.8% を達成し、ビジョンバックボーン分野で新たな最先端を樹立した。
  • VAN-B2 は ADE20K におけるセマンティックセグメンテーションベンチマークで、mIoU 50.1%(Swin-T の 46.1%)を記録し、4 パcentage ポints の上回りを達成した。
  • COCO 物体検出ベンチマークにおいて、VAN-B2 は AP 48.8% を達成し、Swin-T の 46.2% を 2.6 パーセンテージポイント上回った。
  • パノプティックセグメンテーションにおいて、VAN-B6 は COCO データセットで 58.2 PQ を達成し、新たな最先端を樹立した。
  • 細粒度分類の CUB-200 データセットでは、VAN-B4 はタスク特化設計なしにトップ-1正確度 91.3% を達成し、DeiT や ViT-B を上回った。
  • サリエンシー検出において、VAN-B2 は DUTS-TE で F_max 0.919 を達成し、MAE が 0.028 と低く抑えられ、ResNet や PVT バックボーンを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。