Skip to main content
QUICK REVIEW

[論文レビュー] SP-ViT: Learning 2D Spatial Priors for Vision Transformers

Yuxuan Zhou, Wangmeng Xiang|arXiv (Cornell University)|Jun 15, 2022
Brain Tumor Detection and Classification被引用数 7
ひとこと要約

本稿では、空間的誘導バイアスを自動で発見できる、パラメータ化された空間関係関数をニューラルネットワークで表現する学習可能アテンションメカニズムであるSpatial Prior–enhanced Self-Attention (SP-SA)を提案する。SP-SAを用いたSP-ViTモデルは、先行SOTAモデルと比較して50%少ないパラメータでImageNet-1Kで86.3%のTop-1精度を達成し、最先端の性能を実現した。

ABSTRACT

Recently, transformers have shown great potential in image classification and established state-of-the-art results on the ImageNet benchmark. However, compared to CNNs, transformers converge slowly and are prone to overfitting in low-data regimes due to the lack of spatial inductive biases. Such spatial inductive biases can be especially beneficial since the 2D structure of an input image is not well preserved in transformers. In this work, we present Spatial Prior-enhanced Self-Attention (SP-SA), a novel variant of vanilla Self-Attention (SA) tailored for vision transformers. Spatial Priors (SPs) are our proposed family of inductive biases that highlight certain groups of spatial relations. Unlike convolutional inductive biases, which are forced to focus exclusively on hard-coded local regions, our proposed SPs are learned by the model itself and take a variety of spatial relations into account. Specifically, the attention score is calculated with emphasis on certain kinds of spatial relations at each head, and such learned spatial foci can be complementary to each other. Based on SP-SA we propose the SP-ViT family, which consistently outperforms other ViT models with similar GFlops or parameters. Our largest model SP-ViT-L achieves a record-breaking 86.3% Top-1 accuracy with a reduction in the number of parameters by almost 50% compared to previous state-of-the-art model (150M for SP-ViT-L vs 271M for CaiT-M-36) among all ImageNet-1K models trained on 224x224 and fine-tuned on 384x384 resolution w/o extra data.

研究の動機と目的

  • 空間的誘導バイアスの欠如により、低データ環境下でのVision Transformerの収束遅延および過学習を解消すること。
  • 局所的受容 field を超える多様な空間的関係を捉えることができる、手作業で設計された畳み込み的誘導バイアスの代替となる学習可能な代替手法を開発すること。
  • 動的でデータ駆動のアテンションメカニズムを通じて、グローバルな受容 field を維持しながら補完的な空間的事前知識を学習すること。
  • 固定された誘導バイアスを適応的でニューラルパラメータ化された空間関係関数に置き換えることで、モデルの効率性と精度を向上させること。

提案手法

  • SP-SAは、相対的なパッチ座標をアテンションスコアにマップする学習可能な空間関係関数を導入することで、通常の自己注意機構を強化し、特定の空間的関係に動的に注目できるようにする。
  • 空間関係関数は多層パーセプトロン(MLP)によってパラメータ化され、トレーニング中にViTと同時に最適化されるため、モデルが有効な空間的事前知識を自律的に発見できる。
  • 各アテンションヘッドは独自の空間的事前知識を学習し、ネットワーク全体で局所的および非局所的な空間的依存関係を補完的にモデル化できる。
  • 固定された位置埋め込みを、入力コンテンツと相対的位置の両方に適応する学習可能な非線形空間的事前知識に置き換える。
  • SP-ViTは、ViTの標準的なアテンションブロックをSP-SAブロックに置き換えることで構築され、アーキテクチャの単純性を保ちつつ誘導バイアスを強化する。
  • モデルは224×224でImageNet-1Kでトレーニングされ、384×384でファインチューニングされるが、追加データや大規模解像度での事前学習は一切使用しない。

実験結果

リサーチクエスチョン

  • RQ1固定された局所的受容 field を超える多様な2次元空間的関係を捉えることができる、学習可能で非線形な空間的事前知識は、Vision Transformerの性能向上に寄与するか?
  • RQ2ViTアーキテクチャと同時に最適化されるニューラル空間関係関数は、固定された位置埋め込みや手作業で設計されたバイアスと比較して、より良い一般化性能と高速な収束を実現するか?
  • RQ3各アテンションヘッドおよび層ごとに固有の空間的事前知識を学習させることで、共有または単一の事前知識よりも、補完的な空間的誘導バイアスを効果的にモデル化できるか?
  • RQ4既存のSOTA ViTモデルと比較して、SP-ViTはどの程度のパラメータ削減を実現しながら、精度を維持または向上させられるか?

主な発見

  • SP-ViT-LはImageNet-1Kで86.3%のTop-1精度を達成し、CaiT-M-36など先行SOTAモデルを上回る新たな最先端性能を記録した。
  • SP-ViT-LはCaiT-M-36(271M)と比較して約50%(150M)のパラメータ削減を達成し、顕著な効率性の向上を示した。
  • ヘッドおよび層ごとに固有の空間的事前知識を学習するモデルは83.6%のTop-1精度を達成し、共有または単一の事前知識を用いた設定を上回った。
  • SP-SAは1次元または2次元の相対的位置埋め込みを用いた通常の自己注意機構よりも顕著に優れた性能を示し、学習可能で非線形な空間的事前知識の優位性を裏付けた。
  • アブレーションスタディの結果、非線形空間関係関数が不可欠であることが確認された。線形または固定パラメータの代替手法では劣った性能が得られた。
  • SP-SAはPositional Self-Attention や Local SA といった手作業で設計された手法をも凌駆し、学習可能な事前知識が手動設計を上回る優れた結果をもたらすことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。