[論文レビュー] PyramidTNT: Improved Transformer-in-Transformer Baselines with Pyramid Architecture
PyramidTNTは、階層的なピラミッドアーキテクチャと畳み込みスタムを導入することで、Transformer-in-Transformer(TNT)バックボーンの性能を向上させ、画像分類および物体検出で最先端の性能を達成した。わずか3.3B FLOPsでImageNet-1Kで82.0%のtop-1精度を達成し、Swin-Tや元のTNTを上回りながらも、計算コストを低く抑えている。
Transformer networks have achieved great progress for computer vision tasks. Transformer-in-Transformer (TNT) architecture utilizes inner transformer and outer transformer to extract both local and global representations. In this work, we present new TNT baselines by introducing two advanced designs: 1) pyramid architecture, and 2) convolutional stem. The new "PyramidTNT" significantly improves the original TNT by establishing hierarchical representations. PyramidTNT achieves better performances than the previous state-of-the-art vision transformers such as Swin Transformer. We hope this new baseline will be helpful to the further research and application of vision transformer. Code will be available at https://github.com/huawei-noah/CV-Backbones/tree/master/tnt_pytorch.
研究の動機と目的
- 視覚タスクにおけるTransformer-in-Transformer(TNT)アーキテクチャの性能を向上させるために、階層的特徴学習を導入すること。
- 標準的なパッチ化スタムの代わりに畳み込みスタムを採用することで、訓練の安定性と表現学習を向上させること。
- Swin Transformer や元のTNTと比較して優れた性能を示す、より強力な新しいベースラインを確立すること。
- 段階的な空間解像度の低下を伴うピラミッド構造を用いて、効率的なマルチスケール特徴抽出を可能にすること。
提案手法
- 4段階のピラミッドアーキテクチャを導入し、各段階で空間解像度を2倍に縮小することで、階層的特徴学習を可能にする。
- 5つの3x3畳み込み層を備えた畳み込みスタムを採用し、パッチ埋め込みの精度と訓練の安定性を向上させる。
- 段階間のダウンサンプリングにパッチマージング層を用い、特徴階層を保持するとともにシーケンス長を短縮する。
- 外側のトランスフォーマーがグローバル表現を処理し、内側のトランスフォーマーが局所的なパッチ関係をモデル化する二重ブランチ構造を採用する。
- 学習可能な縮小率を備えた学習可能な空間縮小注意(LSRA)を導入し、局所的トークンを圧縮する。
- 重み減衰、AdamW最適化アルゴリズム、マルチスケールデータオーグメンテーションを含む標準的な訓練手法を用いて、頑健性を向上させる。
実験結果
リサーチクエスチョン
- RQ1ピラミッドアーキテクチャは、視覚タスクにおけるTNTモデルの表現能力を向上させることができるか?
- RQ2標準的なパッチ化スタムを畳み込みスタムに置き換えることで、訓練の安定性と性能が向上するか?
- RQ3PyramidTNTは、FLOPsを削減しながらも、Swin Transformer やTNTと同等の最先端のビジョントランスフォーマーを上回る精度を達成できるか?
- RQ4PyramidTNTにおける階層的特徴学習は、COCOでの物体検出性能にどのように影響を与えるか?
主な発見
- PyramidTNT-Sは、わずか3.3B FLOPsでImageNet-1Kで82.0%のtop-1精度を達成し、元のTNT-SおよびSwin-Tを上回った。
- COCO物体検出において、RetinaNetを用い1xスケジュールで42.0 mAPを達成し、Swin-Tを0.5 mAP上回った。
- マルチスケール訓練と3xスケジュールを適用した場合、Mask R-CNNで51.0 mAPを達成し、Hire-MLP-Sを0.9 mAP上回ったが、FLOPsは少なく抑えられた。
- モデルはすべてのバックボーンサイズ(Ti, S, M, B)で強力な性能を維持しており、FLOPsは0.6Bから16.0Bの範囲で変動した。
- ピラミッド構造と畳み込みスタムの組み合わせにより、特に物体検出タスクにおける大規模物体の特徴表現が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。