Skip to main content
QUICK REVIEW

[論文レビュー] Locally Enhanced Self-Attention: Combining Self-Attention and Convolution as Local and Context Terms

Chenglin Yang, Siyuan Qiao|arXiv (Cornell University)|Jul 12, 2021
Advanced Neural Network Applications参考文献 52被引用数 4
ひとこと要約

本稿では、共有されたクエリ/キー/バリューの投影を用いて自己注意を局所的(単項)および文脈的(二項)項に分解する、新たな注目メカニズムであるLocally Enhanced Self-Attention(LESA)を提案する。局所項はグループ化畳み込みによって強化され、両項を動的かつ適応的に融合するモジュールが導入され、パラメータ数を少なくしたにもかかわらずImageNet、COCO検出およびインスタンスセグメンテーションのベンチマークで最先端の性能を達成した。

ABSTRACT

Self-Attention has become prevalent in computer vision models. Inspired by fully connected Conditional Random Fields (CRFs), we decompose self-attention into local and context terms. They correspond to the unary and binary terms in CRF and are implemented by attention mechanisms with projection matrices. We observe that the unary terms only make small contributions to the outputs, and meanwhile standard CNNs that rely solely on the unary terms achieve great performances on a variety of tasks. Therefore, we propose Locally Enhanced Self-Attention (LESA), which enhances the unary term by incorporating it with convolutions, and utilizes a fusion module to dynamically couple the unary and binary operations. In our experiments, we replace the self-attention modules with LESA. The results on ImageNet and COCO show the superiority of LESA over convolution and self-attention baselines for the tasks of image recognition, object detection, and instance segmentation. The code is made publicly available.

研究の動機と目的

  • 標準的な自己注意における局所項の寄与が限られている問題に取り組む。これは、正確な特徴表現に不可欠であるが、ソフトマックス正規化のため活用が不十分である。
  • アイデンティティスキップ接続の弱さを克服するため、グループ化畳み込みを統合することで、自己注意における単項(局所的)項の表現能力を向上させる。
  • 入力に依存する注目重みを用いて局所的および文脈的項を動的かつ適応的に結合する。これにより、視覚タスク全体の性能向上が可能となる。
  • 並列で学習可能な融合メカニズムを通じて畳み込みと自己注意を組み合わせることで、従来の手法よりも精度と効率性に優れた性能が得られることを実証する。

提案手法

  • 完全連結CRFにインspiredして、共有クエリ、キー、バリューの投影を用いて自己注意を単項(局所的)および二項(文脈的)項に分解する。
  • アイデンティティスキップ接続の代わりにグループ化畳み込みを用いることで、単項項の局所的特徴学習を強化する。
  • グループ化畳み込みの後に投影層を適用することで、マルチヘッド注意を実装し、マルチヘッドの表現能力を維持する。
  • 空間的およびチャネルワイズに適応する学習可能な重みωˡ(x)を計算する動的融合モジュールを提案し、二項項を要素ごとの加算の前に変調する。
  • 単項項および二項項の両方に同じ入力特徴を用いることで、パラメータ効率性を確保するとともに、エンドツーエンドの学習を可能にする。
  • ResNetおよびWRNバックボーンの空間畳み込み層を、最後の2段階でLESAに置き換え、ImageNet、COCO検出およびインスタンスセグメンテーションで評価する。

実験結果

リサーチクエスチョン

  • RQ1自己注意における局所項を著しく強化することで、グローバルな文脈モデリングを損なわず、特徴表現を向上させることは可能か?
  • RQ2自己注意の単項項に畳み込み操作を統合することで、標準的な自己注意や畳み込み単体よりも優れた性能が得られるか?
  • RQ3入力に依存する動的融合機構は、局所的および文脈的項の静的または固定重み融合を上回る性能を発揮できるか?
  • RQ4提案された局所強化自己注意(LESA)は、既存のハイブリッド畳み込み-自己注意アーキテクチャよりも効果的かつパラメータ効率的か?

主な発見

  • ResNet50を用いたImageNetでは、LESAがトップ-1精度79.55%を達成し、自己注意(78.69%)およびAttention Augmentation(78.74%)を上回り、パラメータ数も少ない。
  • COCOオブジェクト検出およびインスタンスセグメンテーションにおいて、WRN50バックボーンを用いたLESAは、小・中・大サイズのオブジェクトすべてで畳み込み、自己注意、可変畳み込みベースラインを上回るmAPを達成した。
  • アブレーションスタディにより、動的融合モジュールが不可欠であることが確認され、LESA(トップ-1 79.55%)は静的LESA(79.12%)を顕著に上回った。
  • LESAは、局所的特徴を強化することで、大規模な類似度行列への依存度を低下させた。これは、自己注意モデルに一般的に見られるメモリ非効率性の緩和に寄与する可能性がある。
  • インスタンスセグメンテーションにおいて、マスク品質およびオブジェクトの詳細検出が向上した。これは、局所的・文脈的特徴の統合学習によるより良い意味的整合性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。