[論文レビュー] TopFormer: Token Pyramid Transformer for Mobile Semantic Segmentation
TopFormerは、マルチスケール特徴を抽出するトークンピラミッドモジュールと、スケールに敏感なグローバル表現をローカルトークンに統合するセマンティクスインジェクション機構を備えた、モバイル最適化されたビジョントランスフォーマーを提案する。このモデルは、モバイルデバイス上でMobileNetV3よりも5%高いmIoUを達成しながら、遅延を低減しており、ティニー版ではARMベースのハードウェアでもリアルタイム推論を可能にする。
Although vision transformers (ViTs) have achieved great success in computer vision, the heavy computational cost hampers their applications to dense prediction tasks such as semantic segmentation on mobile devices. In this paper, we present a mobile-friendly architecture named extbf{To}ken extbf{P}yramid Vision Trans extbf{former} ( extbf{TopFormer}). The proposed extbf{TopFormer} takes Tokens from various scales as input to produce scale-aware semantic features, which are then injected into the corresponding tokens to augment the representation. Experimental results demonstrate that our method significantly outperforms CNN- and ViT-based networks across several semantic segmentation datasets and achieves a good trade-off between accuracy and latency. On the ADE20K dataset, TopFormer achieves 5\% higher accuracy in mIoU than MobileNetV3 with lower latency on an ARM-based mobile device. Furthermore, the tiny version of TopFormer achieves real-time inference on an ARM-based mobile device with competitive results. The code and models are available at: https://github.com/hustvl/TopFormer
研究の動機と目的
- モバイル用セマンティックセグメンテーションに特化した、軽量で効率的なビジョントランスフォーマーのアーキテクチャを設計すること。
- リソース制約のあるデバイスにおける密度予測タスクにおける標準トランスフォーマーの高い計算コストを解消すること。
- ARMベースのモバイルCPU上でMobileNetV3を上回る精度を実現しながら、遅延を低減すること。
- モデルの量子化やGPUアクセcelerationなしに、モバイルデバイスでリアルタイム推論を可能にすること。
- オブジェクト検出などの他の密度予測タスクへも一般化可能なアーキテクチャを提供すること。
提案手法
- トークンピラミッドモジュールは、高速なダウンサンプリングを伴うスタックされた軽量なMobileNetV2ブロックを用いて、高解像度画像を処理し、マルチスケール特徴トークンを生成する。
- セマンティクスエクストラクタは、平均プーリングを用いて、異なる段階からのトークンを非常に小さな解像度(入力サイズの1/64程度)に集約し、その後、トランスフォーマーブロックに通してスケールに敏感なグローバルセマンティクスを学習する。
- セマンティクスインジェクションモジュールは、スケールに敏感なグローバルセマンティクスをチャネルごとに分割し、各スケールに対応するトークンに再統合することで表現を強化する。
- インジェクションされたトークンはセグメンテーションヘッドの入力として使用され、最小限の計算オーバーヘッドで階層的特徴学習を実現する。
- トランスフォーマーブロックに残差接続を適用することで、グローバルセマンティクスにおけるスケールに敏感な特徴を保持する。
- モデルは、Ade20K、Pascal Context、COCO-Stuffの各データセットで評価されるように、クロスエントロピー損失とDice損失を用いてエンドツーエンドで訓練される。
実験結果
リサーチクエスチョン
- RQ1モバイルCPU上でセマンティックセグメンテーションの高精度と低遅延を両立できるビジョントランスフォーマーを設計できるか?
- RQ2スケールに敏感なグローバルセマンティクスを効率的に抽出し、マルチスケール特徴に統合することで表現力を向上させられるか?
- RQ3ハイブリッドCNN-Transformerアーキテクチャが、モバイルデバイス上での精度と推論速度の両面でMobileNetV3を上回れるか?
- RQ4提案手法は、オブジェクト検出などの他の密度予測タスクにも一般化可能か?
- RQ5モバイルデプロイメントにおいて、モデルサイズ、FLOPs、推論遅延の最適なトレードオフは何か?
主な発見
- ADE20Kの検証セットでは、TopFormer-Bは1.25 GFLOPsで45.28%のmIoUを達成し、MobileNetV3を5%上回る精度を実現しながら遅延を低減した。
- TopFormerのティニー版(TopFormer-T)は、ARMベースのSnapdragon 865 CPU上で110msの遅延でリアルタイム推論を達成し、0.44 GFLOPsの計算量であった。
- Pascal Contextでは、TopFormer-Sは60カテゴリで0.80 GFLOPsのバックボーンと0.18 GFLOPsのヘッドで43.68%のmIoUを達成し、これまでのすべてのCNNおよびViTベースの手法を上回った。
- COCO-Stuffでは、TopFormer-Bは1.38 GFLOPsで33.43%のmIoUを達成し、同等の計算量のMobileNetV3よりも8%高い精度を示した。
- COCOでのオブジェクト検出では、TopFormer-SをバックボーンとするRetinaNetが3.7 GFLOPsで30.4%のmAPを達成し、FLOPsを低減しながらMobileNetV3やShuffleNetを上回った。
- セマンティクスエクストラクタは、総パラメータの74%を占めながらも、実際の遅延に10%しか寄与しなかったため、計算効率が非常に高いことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。