[論文レビュー] A Simple Single-Scale Vision Transformer for Object Localization and Instance Segmentation
本稿では、階層的設計やマルチスケール特徴量を用いない単一スケールのビジョントランスフォーマーバックボーンであるUniversal Vision Transformer (UViT)を提案する。特徴量解像度と隠れ層次元を一定に保ち、段階的なウィンドウ付き自己注意機構を用いることで、COCOベンチマークにおいて、パラメータ数を著しく減らし、効率を向上させつつ、オブジェクト検出およびインスタンスセグメンテーションで優れた性能を達成する。
This work presents a simple vision transformer design as a strong baseline for object localization and instance segmentation tasks. Transformers recently demonstrate competitive performance in image classification tasks. To adopt ViT to object detection and dense prediction tasks, many works inherit the multistage design from convolutional networks and highly customized ViT architectures. Behind this design, the goal is to pursue a better trade-off between computational cost and effective aggregation of multiscale global contexts. However, existing works adopt the multistage architectural design as a black-box solution without a clear understanding of its true benefits. In this paper, we comprehensively study three architecture design choices on ViT -- spatial reduction, doubled channels, and multiscale features -- and demonstrate that a vanilla ViT architecture can fulfill this goal without handcrafting multiscale features, maintaining the original ViT design philosophy. We further complete a scaling rule to optimize our model's trade-off on accuracy and computation cost / model size. By leveraging a constant feature resolution and hidden size throughout the encoder blocks, we propose a simple and compact ViT architecture called Universal Vision Transformer (UViT) that achieves strong performance on COCO object detection and instance segmentation tasks.
研究の動機と目的
- 畳み込みニューラルネットワーク(CNN)に由来する階層的設計(例:マルチスケール特徴量、空間的縮小)が、密度予測タスクにおけるビジョントランスフォーマーに不可欠であるという仮定に挑戦すること。
- ベーシックなビジョントランスフォーマーのアーキテクチャが、オブジェクト検出およびインスタンスセグメンテーションの強力で最小限のベースラインとして機能できるかどうかを評価すること。
- ViTにおけるマルチスケール特徴量、チャネル倍増、空間的縮小といったアーキテクチャ的選択の真の利点を特定すること。
- 精度、FLOPs、モデルサイズのトレードオフを最適化するための、複合的スケーリング則を確立すること。
- 自己注意機構が本質的に非局所的コンテキストを捉えることができることを示し、明示的な特徴量ピラミッドの必要性を低減すること。
提案手法
- すべてのエンコーダーブロックで特徴量解像度と隠れ層次元を一定に保ち、空間的ダウンサンプリングやマルチスケール特徴量設計を回避する単一スケールのビジョントランスフォーマー(UViT)を提案する。
- 深さに応じてウィンドウサイズが増加する段階的ウィンドウ付き自己注意機構を導入し、計算コストを低減しながら性能を維持する。
- 深さ、幅、入力解像度のすべてに一様なスケーリング戦略を適用し、精度と効率のトレードオフを最適化する。
- COCO 2017でオブジェクト検出およびインスタンスセグメンテーションを実行する際、標準のCascade Mask R-CNNフレームワークを用い、896×896解像度でのマルチスケール学習を実施する。
- ImageNet-1Kのラベルなしデータを用いた自己学習と疑似ラベル付けを適用し、さらに性能を向上させる。
- 空間的縮小、チャネル倍増、マルチスケール特徴量の影響を分離するため、広範なアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1オブジェクト検出やインスタンスセグメンテーションといった密度予測タスクにおいて、CNNのマルチステージで階層的な設計がビジョントランスフォーマーに不可欠であるか?
- RQ2解像度と隠れ層次元を一定に保ったベーシックなビジョントランスフォーマーが、より複雑でカスタマイズされたViTアーキテクチャを上回ることができるか?
- RQ3ViTにおけるマルチスケール特徴量、空間的縮小、チャネル倍増の実際の貢献度は何か?
- RQ4段階的ウィンドウ付き自己注意機構は、高解像度検出タスクにおいて性能を損なわず、計算コストを低減できるか?
- RQ5精度、FLOPs、モデルサイズのトレードオフを最適化するための、ViT向けの複合的スケーリング則をどのように設計できるか?
主な発見
- UViTは、パラメータ数74.4M、FLOPs 1160.1 GFLOPsで、COCOインスタンスセグメンテーションにおいて52.5 box APおよび44.8 mask APを達成し、Swin-BおよびResNet-152を効率面で上回る。
- 自己学習を適用したUViT-Bは、ベースモデル比でそれぞれ1.4%、1.3%の向上を示し、53.9 box APおよび46.1 mask APを達成する。
- Swin Transformerと同等のFLOPsで比較した場合、UViTモデルは少なくとも44.9%のパラメータを削減しており、パラメータ効率が優れていることが示された。
- アブレーションスタディの結果、マルチスケール特徴量と空間的縮小はViTにおいてほとんど利益をもたらさない一方で、段階的ウィンドウ化により計算コストが低減され、性能は安定していることが確認された。
- 提案された複合的スケーリング則により、UViT-T(<40Mパラメータ)のようなコンパクトなバージョンが作成可能であり、COCOベンチマークで強力な精度を維持している。
- これらの結果は、CNN由来の修正を加えないオリジナルのViT設計哲学が、密度予測タスクの強力でシンプルなベースラインとして機能できることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。