[論文レビュー] Scalable Vision Transformers with Hierarchical Pooling
本稿では、段階的プーリングを介して視覚的トークンを段階的にダウンサンプリングすることで、シーケンス長と計算コストを削減するスケーラブルなビジョントランスフォーマーモデル、階層的ビジョントランスフォーマー(HVT)を提案する。クラストークンをパッチトークンの平均プーリングに置き換えることで、FLOPsが同等のままImageNetでDeiTを3.03%上回るトップ1精度を達成する。同時に、深さ、幅、解像度、パッチサイズの効率的スケーリングが可能となり、計算コストの増加なしに性能向上が実現される。
The recently proposed Visual image Transformers (ViT) with pure attention have achieved promising performance on image recognition tasks, such as image classification. However, the routine of the current ViT model is to maintain a full-length patch sequence during inference, which is redundant and lacks hierarchical representation. To this end, we propose a Hierarchical Visual Transformer (HVT) which progressively pools visual tokens to shrink the sequence length and hence reduces the computational cost, analogous to the feature maps downsampling in Convolutional Neural Networks (CNNs). It brings a great benefit that we can increase the model capacity by scaling dimensions of depth/width/resolution/patch size without introducing extra computational complexity due to the reduced sequence length. Moreover, we empirically find that the average pooled visual tokens contain more discriminative information than the single class token. To demonstrate the improved scalability of our HVT, we conduct extensive experiments on the image classification task. With comparable FLOPs, our HVT outperforms the competitive baselines on ImageNet and CIFAR-100 datasets. Code is available at https://github.com/MonashAI/HVT
研究の動機と目的
- 標準的なビジョントランスフォーマー(ViT)が推論全体で完全なパッチシーケンスを維持するための高い計算コストと、階層的表現の欠如を解決する。
- 段階的プーリングによるシーケンス長の短縮を通じて、モデルのスケーラビリティを向上させ、深さ、幅、解像度、パッチサイズの効率的スケーリングを可能にする。
- 平均プールドの視覚的トークンが、1つの学習可能なクラストークンよりもより判別力の高い情報を含むことから、分類にあたって後者に依存する必要がなくなることを示す。
- 計算コストを増加させることなく、節約されたFLOPsを再割り当てすることで、モデル容量を増強し、画像分類ベンチマークで最先端の性能を達成する。
提案手法
- 複数段階にわたりシーケンス長をダウンサンプリングする階層的プーリング機構を導入し、畳み込みニューラルネットワーク(CNN)における空間的ダウンサンプリングに類似させる。
- ViTブロックを段階に分割し、各段階の後に平均プーリングまたはマックスプーリングを適用することで、段階的にシーケンス長と計算負荷を低減する。
- 学習可能なクラストークンをすべてのパッチトークンのグローバル平均プーリングに置き換え、最終的な予測ベクトルを生成する。
- 深さ、幅、入力解像度、パッチサイズの独立したスケーリングを可能にするアーキテクチャを設計し、節約されたFLOPsをモデル容量の向上に活用する。
- 一部の実験では2次元プーリングを採用し、パッチサイズの縮小による空間的ダウンサンプリングを検討するが、ヘッド数とブロックスケジューリングに注意を要する。
- 異なる数のアテンションヘッド、入力解像度、パッチサイズを用いたモデルを訓練し、スケーラビリティとパフォーマンスのトレードオフを評価する。

実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマーにおける階層的プーリングは、シーケンス長と計算コストを低減しつつ、精度を維持または向上させることができるか?
- RQ2クラストークンをパッチトークンの平均プーリングに置き換えることで、専用のクラストークンを使用する場合よりも分類性能が向上するか?
- RQ3階層的プーリングを用いることで、FLOPsを同等に保ったまま、深さ、幅、解像度、パッチサイズのモデル容量をどの程度スケールアップできるか?
- RQ4ImageNetおよびCIFAR-100において、FLOPs制約が同等の強力なベースライン(DeiT)と比較して、HVTのパフォーマンスはどの程度優れているか?
- RQ52次元プーリングのモデルパフォーマンスへの影響は何か?また、適切なアーキテクチャ調整によりさらなる向上が可能か?
主な発見
- FLOPsが同等(1.25 vs. 1.39 GFLOPs)であるにもかかわらず、HVT-Ti-4はImageNetでDeiT-Tiを3.03%上回るトップ1精度を達成した。
- CIFAR-100では、パッチサイズ8のHVT-S-4が77.29%のトップ1精度を達成し、32パッチサイズのバージョンに対して9.14%の向上を示した。
- 入力解像度を160から384に引き上げることで、トップ1精度は73.84%から76.31%に向上し、高解像度表現の利点を示した。
- 16アテンションヘッドを搭載したHVT-S-4は75.43%のトップ1精度を達成し、3ヘッドバージョンを6.79ポイント上回った。
- 2Dプーリングを採用したHVT-S-2はCIFAR-100で77.58%のトップ1精度を達成し、FLOPsがほぼ同一のDeiT-S(71.99%)を上回った。
- 平均プールドの視覚的トークンは一貫してクラストークンを上回る性能を示し、より豊かな判別力を持つことが示された。
![Figure 2 : Overview of the proposed Hierarchical Visual Transformer. To reduce the redundancy in the full-length patch sequence and construct a hierarchical representation, we propose to progressively pool visual tokens to shrink the sequence length. To this end, we partition the ViT [ 11 ] blocks i](https://ar5iv.labs.arxiv.org/html/2103.10619/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。