Skip to main content
QUICK REVIEW

[論文レビュー] GPViT: A High Resolution Non-Hierarchical Vision Transformer with Group Propagation

Chenhongyi Yang, Jiarui Xu|arXiv (Cornell University)|Dec 13, 2022
Domain Adaptation and Few-Shot Learning被引用数 7
ひとこと要約

GPViTは、高解像度特徴と、学習可能なグループトークンとMLPMixerベースの伝搬を用いることで、効率的なグローバル情報交換を可能にする、非階層的Vision Transformerを提案する。この手法は、セグメンテーションおよび検出タスクで最先端の性能を達成し、ADE20KにおけるセマンティックセグメンテーションでSwin Transformer-Bを50%少ないパラメータで上回る(2.0 mIoUの向上)。

ABSTRACT

We present the Group Propagation Vision Transformer (GPViT): a novel nonhierarchical (i.e. non-pyramidal) transformer model designed for general visual recognition with high-resolution features. High-resolution features (or tokens) are a natural fit for tasks that involve perceiving fine-grained details such as detection and segmentation, but exchanging global information between these features is expensive in memory and computation because of the way self-attention scales. We provide a highly efficient alternative Group Propagation Block (GP Block) to exchange global information. In each GP Block, features are first grouped together by a fixed number of learnable group tokens; we then perform Group Propagation where global information is exchanged between the grouped features; finally, global information in the updated grouped features is returned back to the image features through a transformer decoder. We evaluate GPViT on a variety of visual recognition tasks including image classification, semantic segmentation, object detection, and instance segmentation. Our method achieves significant performance gains over previous works across all tasks, especially on tasks that require highresolution outputs, for example, our GPViT-L3 outperforms Swin Transformer-B by 2.0 mIoU on ADE20K semantic segmentation with only half as many parameters. Project page: chenhongyiyang.com/projects/GPViT/GPViT

研究の動機と目的

  • 微細な視覚タスクに適した、ネットワーク全体で高解像度特徴を維持する非階層的Vision Transformerの設計。
  • 高解像度設定における自己注意の2次計算コストを軽減し、効率的なグローバル情報交換を実現すること。
  • 密予測タスクにおける性能を維持または向上させながら、ViTにおける階層的(ピラミッド型)設計の必要性を排除すること。
  • 高解像度特徴と効率的なグローバル通信の組み合わせが、正確性と効率性の両面で階層モデルを凌駕できることを示すこと。

提案手法

  • 高解像度ViTにおける標準的な自己注意の代わりに、コアコンponentとしてGroup Propagation Block(GPブロック)を導入する。
  • 学習可能なグループトークンを用いて、高解像度画像特徴を固定数のグループにクラスタリングし、グローバル通信コストを削減する。
  • MLPMixerモジュールを用いて、グループ化された特徴間でのグローバル情報伝搬を実行し、低コストなグローバルモデリングを実現する。
  • クロスアテンションを用いて、更新されたグローバル情報をグループ化された特徴から個々の画像トークンへと戻す。
  • 画像トークン数に対して線形の複雑度を維持し、標準的な自己注意の2次スケーリングを回避する。
  • 特徴のダウンサンプリングやスケールの組み合わせを避けるために、すべての段階でGPブロックを単純に使用する非階層的アーキテクチャを構築する。

実験結果

リサーチクエスチョン

  • RQ1フル解像度特徴を有する非階層的Vision Transformerは、セグメンテーションや検出のような密予測タスクで階層モデルを上回ることができるか?
  • RQ22次計算コストを伴わず、高解像度ViTで効率的なグローバル情報交換を実現することは可能か?
  • RQ3グローバル通信機構(例:グローバルアテンション、畳み込み、ウィンドウアテンション)と比較して、GPブロックは正確性と効率性の両面で優れているか?
  • RQ4パラメータ数と計算コストのバランスを最適化するためのグループトークンの最適な数と構成は何か?
  • RQ5局所的アテンションとGPブロックの組み合わせは、高解像度設定において局所的アテンション単体よりも優れた性能を発揮するか?

主な発見

  • GPViT-L3は、ADE20KにおけるセマンティックセグメンテーションでSwin Transformer-Bを2.0 mIoU上回り、パラメータ数は半分に削減した。
  • GPViT-L1は、COCOにおけるインスタンスセグメンテーションで2.6 APbbと1.4 mkの向上を達成し、パラメータ数は30%削減した。
  • GPViT-L2は、ADE20KにおけるセマンティックセグメンテーションでSwin Transformer-Bを0.5 mIoU上回り、パラメータ数は40%削減した。
  • GPブロックは、グローバルアテンションやウィンドウアテンションを含む、テストされたすべてのグローバル通信手法の中で、ImageNet(80.5%)およびADE20K(46.9 mIoU)で最高の正確性を達成した。
  • 1ブロックあたり64個のグループトークンを用い、段階を経て16に段階的に減少させると、正確性とFLOPsのトレードオフにおいて最良のバランスが得られた。
  • ImageNetではFLOP数が5.8G、ADE20Kでは34Gを維持し、ベースラインの局所的アテンションモデルと同等の計算コストであったが、正確性を顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。