Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding

Pengchuan Zhang, Xiyang Dai|arXiv (Cornell University)|Mar 29, 2021
Advanced Neural Network Applications被引用数 6
ひとこと要約

本稿では、マルチスケール階層的設計とLongformerの2次元版である局所+グローバル注意メカニズムを組み合わせた、マルチスケールビジョン・ロングフォーマー(ViL)というビジョントランスフォーマーモデルを提案する。このアーキテクチャにより、線形計算複雑度を実現し、高解像度画像の符号化を効率的に行える。モデルは、パrameter数とFLOPsを減らしながらも、画像分類、物体検出、インスタンスセグメンテーションのタスクで、強力なベースライン(ResNet、PVT、Swinトランスフォーマー)を上回る性能を達成した。

ABSTRACT

This paper presents a new Vision Transformer (ViT) architecture Multi-Scale Vision Longformer, which significantly enhances the ViT of \cite{dosovitskiy2020image} for encoding high-resolution images using two techniques. The first is the multi-scale model structure, which provides image encodings at multiple scales with manageable computational cost. The second is the attention mechanism of vision Longformer, which is a variant of Longformer \cite{beltagy2020longformer}, originally developed for natural language processing, and achieves a linear complexity w.r.t. the number of input tokens. A comprehensive empirical study shows that the new ViT significantly outperforms several strong baselines, including the existing ViT models and their ResNet counterparts, and the Pyramid Vision Transformer from a concurrent work \cite{wang2021pyramid}, on a range of vision tasks, including image classification, object detection, and segmentation. The models and source code are released at \url{https://github.com/microsoft/vision-longformer}.

研究の動機と目的

  • 高解像度画像を処理する際、標準的なビジョントランスフォーマー(ViT)が示す2次関数的計算量およびメモリ複雑度を軽減すること。
  • 物体検出やセグメンテーションなどの密度予測タスクに必要な高解像度特徴マップの効率的符号化を可能にすること。
  • ビジョンと言語モデルアーキテクチャを統合するために、マルチスケールビジョンタスクでCNNの性能を上回るか同等の性能を示すビジョントランスフォーマーを設計すること。
  • 性能を維持しつつ計算コストを削減する、ビジョンに特化した効率的注意メカニズムを設計すること。
  • 提案アーキテクチャの有効性を、分類、検出、セグメンテーションを含む多様なビジョンベンチマークで実証すること。

提案手法

  • 各段階で空間解像度が低く、隠れ次元が増加する複数のビジョントランスフォーマーステージをスタックすることで、ResNet風の階層的特徴学習を模倣するマルチスケールモデル構造を実装する。
  • 各段階でパッチエンコーディングを適用し、特徴マップを段階的にダウンサンプリングするとともに、表現能力を高める。
  • Longformer注意メカニズムの2次元版を導入し、局所ウィンドウ注意と固定数のグローバルトークンを用いることで、シーケンス長に対して線形複雑度を達成する。
  • 絶対位置埋め込みに依存せず、相対位置バイアス(RPB)を用いて注意学習を強化する。
  • 収束性と性能を向上させるために、小規模および中規模バージョンでは3倍以上の訓練スケジュールを採用する。
  • 標準的な検出およびセグメンテーションパイプライン(例:RetinaNet、Mask R-CNN)にアーキテクチャを統合し、エンドツーエンド評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1マルチスケールビジョントランスフォーマーは、高解像度画像タスクにおいて、標準的なViTやResNetを上回る精度と効率を達成できるか?
  • RQ22次元版Longformer注意メカニズムは、標準的な自己注意と比較して、計算量およびメモリコストを削減しながらも性能を維持できるか?
  • RQ3マルチスケール設計と効率的注意の組み合わせは、物体検出やインスタンスセグメンテーションのような密度予測タスクにどのように影響を与えるか?
  • RQ4ウィンドウサイズやグローバルトークン数といったハイパーパrameterが、高解像度環境下でのモデル性能に与える影響は何か?
  • RQ5Swinトランスフォーマーやピラミッドビジョントランスフォーマーと並行して登場したモデルと比較して、提案アーキテクチャは精度、FLOPs、パrameter数の観点で優れているか?

主な発見

  • 3x+MS訓練スケジュールを用いたViL-Tinyは、ImageNet-1K分類タスクでResNeXt101-64x4dやPVT-Largeを上回り、より少ないパラメータ数で高いトップ-1精度を達成した。
  • RetinaNetを用いたCOCO物体検出タスクにおいて、ViL-Smallは4500万パラメータで47.1 AP^bを達成し、Swin-Tiny(4800万パラメータ、46.0 AP^b)を上回った。
  • Mask R-CNNベースのインスタンスセグメンテーションでは、ViL-Smallが42.9 AP^bを達成し、SRA、Performer、グローバル注意など他の効率的注意メカニズムを大きく上回った。
  • アブレーションスタディの結果、物体検出ではウィンドウサイズ15が最適な性能を示し、グローバルトークンを1つ以上追加してもさらなる利益は得られなかった。
  • 部分的注意(例:最初の2段階)を用いても、ViLモデルは完全注意バージョンと比較して僅か0.4 AP^bの差にとどまり、強力な性能を維持した。
  • 同じFLOPsおよびパラメータ予算下で、ヴァニラViTと比較してマルチスケール構造が顕著な精度向上をもたらした。これは階層的特徴学習の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。