Skip to main content
QUICK REVIEW

[論文レビュー] P2T: Pyramid Pooling Transformer for Scene Understanding

Yu-Huan Wu, Yun Liu|arXiv (Cornell University)|Jun 22, 2021
Advanced Neural Network Applications参考文献 71被引用数 11
ひとこと要約

本論文は、マルチヘッド自己注意(MHSA)における単一のプーリング操作をピラミッドプーリングに置き換えることで、シーケンス長を同時に短縮し、文脈表現を強化するビジョントランスフォーマーバックボーンであるピラミッドプーリングトランスフォーマー(P2T)を提案する。P2Tは、ImageNet-1KおよびADE20Kベンチマークにおいて、従来のCNNおよびトランスフォーマーベースのモデルを上回る最先端の性能を達成し、画像分類、セマンティックセグメンテーション、オブジェクト検出、インスタンスセグメンテーションのあらゆるタスクで優れた結果を示す。

ABSTRACT

Recently, the vision transformer has achieved great success by pushing the state-of-the-art of various vision tasks. One of the most challenging problems in the vision transformer is that the large sequence length of image tokens leads to high computational cost (quadratic complexity). A popular solution to this problem is to use a single pooling operation to reduce the sequence length. This paper considers how to improve existing vision transformers, where the pooled feature extracted by a single pooling operation seems less powerful. To this end, we note that pyramid pooling has been demonstrated to be effective in various vision tasks owing to its powerful ability in context abstraction. However, pyramid pooling has not been explored in backbone network design. To bridge this gap, we propose to adapt pyramid pooling to Multi-Head Self-Attention (MHSA) in the vision transformer, simultaneously reducing the sequence length and capturing powerful contextual features. Plugged with our pooling-based MHSA, we build a universal vision transformer backbone, dubbed Pyramid Pooling Transformer (P2T). Extensive experiments demonstrate that, when applied P2T as the backbone network, it shows substantial superiority in various vision tasks such as image classification, semantic segmentation, object detection, and instance segmentation, compared to previous CNN- and transformer-based networks. The code will be released at https://github.com/yuhuan-wu/P2T.

研究の動機と目的

  • パッチトークンによる長いシーケンス長が原因でビジョントランスフォーマーの計算コストが高くなる問題に対処すること。
  • 単一のプーリング操作を超えた、プールドされた特徴の表現力の向上を図ること。
  • ピラミッドプーリングをマルチヘッド自己注意(MHSA)に統合し、シーケンス長を短縮しながらより優れた文脈抽象化を実現すること。
  • 多様なシーン理解タスクに適した汎用的で効率的かつ強力なビジョントランスフォーマーバックボーンを設計すること。
  • MHSAにおけるピラミッドプーリングが、複数のビジョンベンチマークで一貫した性能向上をもたらすことを実証すること。

提案手法

  • MHSAにおける標準的な単一プーリングをピラミッドプーリングに置き換え、異なるカーネルサイズとストライドを持つ複数の平均プーリング操作を入力特徴マップに適用する。
  • 各段階で複数スケール(例:{1, 2, 3, 6})のアダプティブ平均プーリングを用いて、空間的文脈を保持するようにプールド特徴を生成する。
  • プールド特徴を連結または要素ごとの組み合わせによってMHSAに統合し、拡張された多様な受容野を持つ表現に対するグローバルな注目を可能にする。
  • 特に低解像度での効果が顕著な、相対的位置エンコーディング(RPE)を採用して、プールド特徴内の空間的関係をモデル化する。
  • 局所的なインダクティブバイアスを強化し、特徴学習を改善するために、フィードフォワードネットワーク(IRB)に深度分離畳み込みを組み込む。
  • 初期段階での空間的連続性を維持し、特徴表現を向上させるために、オーバーラップするパッチエンベッディングを採用する。

実験結果

リサーチクエスチョン

  • RQ1MHSAにおけるピラミッドプーリングは、シーケンス長を短縮すると同時に、ビジョントランスフォーマーの特徴表現を向上させることができるか?
  • RQ2ビジョントランスフォーマーバックボーンにおいて、ピラミッドプーリングは単一プーリングと比較して性能と効率性に優れているか?
  • RQ3MHSAにピラミッドプーリングを統合することで、分類、セグメンテーション、検出などの多様なビジョンタスクで一貫した向上が得られるか?
  • RQ4プーリングタイプ、プーリング比、活性化関数、位置エンコーディングといった設計選択が、性能に最も大きな影響を与えるか?
  • RQ5ピラミッドプーリングを備えた統合型トランスフォーマーバックボーンは、複数のベンチマークで最先端の結果を達成できるか?

主な発見

  • P2TはImageNet-1Kでトップ-1精度79.7%、ADE20Kセマンティックセグメンテーションで44.1%のmIoUを達成し、ResNet、Swin Transformer、PVTを上回った。
  • 最大プーリングや深度分離畳み込みよりも平均プーリングを採用することで、mIoUが最大2.8%向上し、特徴抽象化において優位性を示した。
  • プールドサイズを固定する代わりに比率を固定することで、GFLOPsを12%削減し、メモリを10%削減できたが、トップ-1精度は0.3%低下、mIoUは2.4%低下したため、固定比率が好ましいと判明した。
  • ベースラインに相対的位置エンコーディング(RPE)を追加すると、トップ-1精度が1.7%、mIoUが1.7%向上し、低解像度のプールド特徴においてその有効性が確認された。
  • フィードフォワードネットワークにIRB(深度分離畳み込み)を追加することで、mIoUが5.4%、トップ-1精度が3.2%向上し、特徴学習における2次元局所性の利点が裏付けられた。
  • オーバーラップするパッチエンベッディングにより、トップ-1精度が0.2%、mIoUが1.4%向上し、特徴表現への肯定的影響が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。