Skip to main content
QUICK REVIEW

[論文レビュー] MoCoViT: Mobile Convolutional Vision Transformer

Hailong Ma, Xin Xia|arXiv (Cornell University)|May 25, 2022
Visual Attention and Saliency Detection被引用数 14
ひとこと要約

MoCoViTは、モバイルに適した畳み込みニューラルネットワークと、効率的なデバイス内ビジョンタスク向けに特化したトランスフォーマーブロックを組み合わせた軽量なモバイル畳み込み型ビジョントランスフォーマーを導入している。モバイル自己注意(MoSA)とモバイルフィードフォワードネットワーク(MoFFN)を採用することで、147M FLOPsの計算量でImageNetのトップ-1精度が74.5%に達し、計算量を抑えながらMobileNetV3を上回り、COCOオブジェクト検出においてはGhostNetを2.1 AP向上させた。

ABSTRACT

Recently, Transformer networks have achieved impressive results on a variety of vision tasks. However, most of them are computationally expensive and not suitable for real-world mobile applications. In this work, we present Mobile Convolutional Vision Transformer (MoCoViT), which improves in performance and efficiency by introducing transformer into mobile convolutional networks to leverage the benefits of both architectures. Different from recent works on vision transformer, the mobile transformer block in MoCoViT is carefully designed for mobile devices and is very lightweight, accomplished through two primary modifications: the Mobile Self-Attention (MoSA) module and the Mobile Feed Forward Network (MoFFN). MoSA simplifies the calculation of the attention map through Branch Sharing scheme while MoFFN serves as a mobile version of MLP in the transformer, further reducing the computation by a large margin. Comprehensive experiments verify that our proposed MoCoViT family outperform state-of-the-art portable CNNs and transformer neural architectures on various vision tasks. On ImageNet classification, it achieves 74.5% top-1 accuracy at 147M FLOPs, gaining 1.2% over MobileNetV3 with less computations. And on the COCO object detection task, MoCoViT outperforms GhostNet by 2.1 AP in RetinaNet framework.

研究の動機と目的

  • モバイルデバイス向けに計算コストを抑えたビジョントランスフォーマーのアーキテクチャを設計すること。
  • 実世界のモバイルアプリケーションにおいて、既存のポータブルCNNおよびビジョントランスフォーマーを上回る精度と効率を実現すること。
  • 畳み込みネットワークとトランスフォーマーの長所を統合した、軽量でモバイル最適化されたフレームワークを構築すること。
  • パフォーマンスを損なわずに、注意機構とフィードフォワード部のFLOPsを削減すること。

提案手法

  • 注意マップの計算を簡素化するためのブランンチ共有方式を採用したモバイル自己注意(MoSA)モジュールを導入する。
  • フィードフォワードパスにおける計算量を削減するための軽量なMLP変種であるモバイルフィードフォワードネットワーク(MoFFN)を提案する。
  • モバイル最適化されたトランスフォーマーブロックにMoSAとMoFFNを統合し、ハイブリッド畳み込み-トランスフォーマー構造で使用可能にする。
  • 誘導的バイアスと長距離モデリングの両立を図るため、モバイル畳み込みと軽量トランスフォーマーブロックを組み合わせたハイブリッドバックボーンを採用する。
  • ImageNetでMoCoViTファミリーを学習し、COCO検出タスクで微調整することで、標準ベンチマークを用いて比較評価を行う。

実験結果

リサーチクエスチョン

  • RQ1精度を損なわずに、モバイルデプロイメントに十分な効率性を備えたビジョントランスフォーマーを実現できるか?
  • RQ2パフォーマンスを維持したまま、モバイルハードウェア向けに自己注意とフィードフォワード部をどのように簡素化できるか?
  • RQ3ハイブリッドモバイル畳み込み型とトランスフォーマー構造は、ImageNetおよびCOCOで最先端のポータブルモデルを上回ることができるか?
  • RQ4モバイルネットワークにトランスフォーマーブロックを統合する際の、FLOPsと精度のトレードオフは何か?

主な発見

  • MoCoViTは147M FLOPsの計算量でImageNetのトップ-1精度を74.5%に達成し、計算量を抑えながらMobileNetV3を1.2%上回った。
  • RetinaNetを用いたCOCOオブジェクト検出タスクにおいて、MoCoViTはGhostNetを2.1 AP向上させた。
  • モバイル自己注意(MoSA)モジュールは、顕著な精度低下を伴わずに、共有ブランチメカニズムにより注意計算を削減した。
  • モバイルフィードフォワードネットワーク(MoFFN)は、標準的なフィードフォワード層と比較して、MLPパスにおけるFLOPsを顕著に削減した。
  • MoCoViTファミリーは、複数のビジョンベンチマークで、最先端のポータブルCNNおよびビジョントランスフォーマーを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。