Skip to main content
QUICK REVIEW

[論文レビュー] EdgeViTs: Competing Light-weight CNNs on Mobile Devices with Vision Transformers

Junting Pan, Adrian Bulat|arXiv (Cornell University)|May 6, 2022
Advanced Neural Network Applications被引用数 14
ひとこと要約

EdgeViTs は、自己注意機構と深さ方向畳み込みを組み合わせた局所-グローバル-局所(LGL)注意メカニズムを統合することで、モバイルデバイス上で最先端の効率的CNNを凌駆する、軽量なビジョンTransformerの新規ファミリーを導入する。モデルは、実機上での画像分類、物体検出、セマンティックセグメンテーションにおいて、精度-遅延および精度-エネルギーのトレードオフにおいてパレート最適を達成し、以前唯一モバイル向けに設計されたViTアーキテクチャであったMobileViTsでさえも上回る性能を発揮する。

ABSTRACT

Self-attention based models such as vision transformers (ViTs) have emerged as a very competitive architecture alternative to convolutional neural networks (CNNs) in computer vision. Despite increasingly stronger variants with ever-higher recognition accuracies, due to the quadratic complexity of self-attention, existing ViTs are typically demanding in computation and model size. Although several successful design choices (e.g., the convolutions and hierarchical multi-stage structure) of prior CNNs have been reintroduced into recent ViTs, they are still not sufficient to meet the limited resource requirements of mobile devices. This motivates a very recent attempt to develop light ViTs based on the state-of-the-art MobileNet-v2, but still leaves a performance gap behind. In this work, pushing further along this under-studied direction we introduce EdgeViTs, a new family of light-weight ViTs that, for the first time, enable attention-based vision models to compete with the best light-weight CNNs in the tradeoff between accuracy and on-device efficiency. This is realized by introducing a highly cost-effective local-global-local (LGL) information exchange bottleneck based on optimal integration of self-attention and convolutions. For device-dedicated evaluation, rather than relying on inaccurate proxies like the number of FLOPs or parameters, we adopt a practical approach of focusing directly on on-device latency and, for the first time, energy efficiency. Specifically, we show that our models are Pareto-optimal when both accuracy-latency and accuracy-energy trade-offs are considered, achieving strict dominance over other ViTs in almost all cases and competing with the most efficient CNNs. Code is available at https://github.com/saic-fi/edgevit.

研究の動機と目的

  • モバイルおよびエッジデバイス上で、軽量ビジョンTransformer(ViTs)と最先端の効率的CNNとの間の性能ギャップを埋めること。
  • FLOPsなどの代理指標ではなく、実際の効率指標(デバイス内遅延、エネルギー消費)に焦点を当てることで、既存のViTsのモバイルデプロイメントにおける制限を克服すること。
  • カスタム演算を必要とせず、標準的なディープラーニングフレームワークで直接デプロイ可能なViTアーキテクチャを設計すること。
  • 高精度を維持しつつ、モバイルハードウェアにおける推論コストを低く保ちながら、物体検出やセマンティックセグメンテーションなどの密度予測タスクで競争力のある性能を達成すること。

提案手法

  • 自己注意と深さ方向畳み込みを構造的かつコスト効率よく統合する、局所-グローバル-局所(LGL)情報交換ボトルネックを提案する。
  • 自己注意を局所的、グローバル的、再結合ステージに分解することで、計算複雑性を低減しつつ、長距離モデリング能力を保持する。
  • CNNにインspiredされた階層的マルチステージアーキテクチャを採用し、空間解像度を段階的にダウンサンプリングすることで、シーケンス長を制御し、2次関数的複雑性を低減する。
  • 深さ方向分離畳み込みを統合することで、局所特徴モデリングを強化し、パラメータ効率を向上させる。
  • ONNX や TensorRT などの標準的なディープラーニングフレームワークを用いた直接デプロイを可能にする設計により、実装のしやすさとデバイス内推論速度の向上を実現する。
  • ImageNet-1Kで訓練し、COCOおよびADE20Kで標準プロトコルに従って微調整することで、多様なビジョンタスクにおける性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ビジョンTransformerが、精度とデバイス内推論効率の両面で、最も効率的な軽量CNNに匹敵またはそれを上回るほど効率化可能だろうか?
  • RQ2自己注意メカニズムに局所畳み込みを統合することで、モバイルハードウェア上で精度を損なわず、著しく効率性が向上するだろうか?
  • RQ3FLOPsとは異なり、実際のデバイス内遅延やエネルギー消費といった実世界の指標は、モバイルデプロイメントにおけるモデル効率の予測子として、FLOPsに比べて優れているだろうか?
  • RQ4標準的なディープラーニングフレームワーク(例:ONNX、TensorRT)を用いて、フレームワーク固有の最適化を必要とせず、ViTベースのアーキテクチャを高精度かつ実用可能にデプロイできるだろうか?
  • RQ5CNNや一般的なViTと比較して、ビジョンTransformerが精度-遅延および精度-エネルギーのトレードオフにおいて、どの程度パレート最適に近づけるだろうか?

主な発見

  • EdgeViT-XXS は ADE20K セマンティックセグメンテーションで 39.7% の mIoU を達成し、同程度の GFLOPs およびパラメータ数の PVTv2-B0 よりも 2.5 パcentポイント高い。
  • EdgeViT-S は ADE20K で 45.9% の mIoU を達成し、PVTv2-B1 よりも 3.4 パcentポイント高い。これは、密度予測タスクにおける強力な性能を示している。
  • RetinaNet を用いた COCO 物体検出では、EdgeViT-XXS が PVTv2-B0 よりも 1.5 AP 高く、マスクセグメンテーションでは Mask R-CNN を用いて 1.7 AP 高い。
  • Samsung Galaxy S21 では、EdgeViT-XXS が 33.3ms で実行され、GFLOPs がより高いにもかかわらず、EfficientNet-B0(52.1ms)よりも高速である。これは、デバイス内効率が優れていることを示している。
  • EdgeViTs は、エネルギー消費が EfficientNet-B0 とわずかに高い程度で、他のViTと比較して、精度-遅延および精度-エネルギーのトレードオフにおいて、厳密な優位性を示している。
  • モデルは、評価されたすべての指標においてパレート最適であり、以前唯一モバイル向けに設計されたViTファミリーであったMobileViTsを、すべてのベンチマークおよび効率指標で上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。